小米发布MiMo-V2.6 Pro与Flash全模态模型并开放权重,xAI推出Grok 4.7,APUS开源决策模型OpenJev-v1
原创 每日发现最新 2026-09-22 18:58 北京
多模态编程模型小米MiMo-V2.6 Pro / Flash,编程与办公模型Grok 4.7,智能体决策模型APUS-OpenJev-v1,小模型智能体MiMo-V2.6-Distill-Qwen-9B,俄语知识与长文本模型Yandex AliceAI-Foundation-80B-A3B-Base
9 月 22 日,今天值得关注的项目覆盖多模态编程、智能体决策与模型训练:小米开放 MiMo-V2.6 系列模型及配套训练资源,Grok 4.7 更新长任务编程与办公能力,APUS-OpenJev-v1 开源决策模型。
💻 综合大模型
★ 小米 MiMo-V2.6 Pro / Flash
结合多模态理解、编程与电脑操作,完成需要持续执行和检查结果的复杂任务。
小米正式发布 MiMo-V2.6 Pro 与 Flash 两个原生全模态模型,同步开放模型权重,API 沿用 V2.5 系列定价。此次升级通过扩大多任务强化学习训练规模,让模型在编程、工具调用和复杂环境中持续尝试,根据执行结果修正后续行动。
官方报告,Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。官方展示的应用包括根据文字、图片或视频搭建交互式游戏场景,在 Blender 中制作三维资产,以及操作图形界面完成信息检索、编辑和数据处理。
开发者可通过开放平台 API 接入,或下载采用 MIT 许可的模型权重。小米同时公开技术报告、训练环境和强化学习代码;桌面客户端也已接入新模型,支持会员订阅或配置自己的 API 凭证使用。
上手门槛
开发接入:🟢 低|开放平台 API 已上线|按量计费
自行部署:🔴 极高|大型模型多卡推理|官方示例分别采用 Pro 八卡、Flash 四卡张量并行
★ Grok 4.7
处理长时间编程、文档与演示文稿任务,加强工具调用中的自我检查与结果核验。
Grok 4.7 于 9 月 21 日正式发布,已接入 Cursor、Grok Build 和 Grok API。相比 Grok 4.6,新版本采用更大的基础模型,并围绕耗时更长、难度更高的任务开展强化学习,重点提升自我检查和长上下文管理能力,标准版本保持上一代的价格与服务速度。
此次更新覆盖软件工程与专业知识工作。官方报告,Grok 4.7 在文档、演示文稿及多小时办公任务评测中较上一代有所提升,适合需要反复处理材料、调用工具并检查交付结果的工作流。
API 支持 50 万 token 上下文、图文输入、工具调用和结构化输出。基础价格从每百万输入 token 2 美元、输出 token 6 美元起,长上下文请求适用相应计费规则。目前模型通过托管服务提供,尚未开放权重。
上手门槛
开发接入:🟢 低|支持标准 API 与工具调用|按量计费
开发者控制台:https://console.x.ai/
⚡ 智能体决策
★ APUS-OpenJev-v1
逆向 JEV 的开源模型,可本地部署,为浏览器 Agent 和业务流程按需切换决策计算深度。
APUS-OpenJev-v1 是 APUS AI-LAB 开放的决策模型系列。包含了4B、9B、35B-A3B 的完整 BF16 权重和原生运行代码。开发者输入任务、上下文与候选动作后,模型会为候选项评分;参考运行代码支持用 effort="low" 或 "high" 调整计算深度。官方在 80 题开发测试集上报告 9B 版本准确率高于Jev API;官方另报告,优化版 9B 在单张 RTX PRO 6000 Blackwell 96GB 显卡上的 HTTP 响应延迟中位数为 25.58 毫秒,Jev API 为 280.80 毫秒。官方提供了 vLLM 部署脚本、统一运行时源码、及标准评测数据集。
上手门槛
自行部署:🟡 中|提供 BF16 权重|vLLM 脚本已提供
🧪 浏览器访问 Skill
★ fast-browser-use
利用本地部署的 Qwen3.5 模型快速扫描网页交互内容,供 Agent 执行交互操作。
fast-browser-use 是 APUS AI-LAB 开源的浏览器自动化工具和 Agent Skill。它用 Playwright 扫描当前页面,将可见按钮、链接等整理为候选动作,再由本地 Qwen3.5 模型评分并选择;执行前检查元素是否仍可见、可操作,任务结束后可用网址、标题或页面文字断言核验结果。项目提供 Claude Code、Codex 等 Agent 可用的 Skill、命令行及 Python 接口。它默认使用 Qwen3.5 9B 或 35B 权重,通过 MLX 或 PyTorch 运行。
上手门槛
开发接入:🟢 较低|9B 权重已开放|提供 SGLang 推理说明,长上下文需预留额外显存
🧪 小模型智能体训练
★ MiMo-V2.6-Distill-Qwen-9B
以 9B 规模处理编程、工具调用与视觉任务,为智能体应用和后续训练提供起点。
小米同步开放 MiMo-V2.6-Distill-Qwen-9B,将 MiMo 生成的任务数据用于 Qwen3.5-9B 的监督微调,形成一款覆盖编程、通用智能体任务、视觉编程与网络安全任务的 9B 模型。开发者可用它测试工具调用流程、构建领域应用,或继续开展强化学习训练。
官方报告,在相同评测口径下,该模型的 SWE Pro 成绩由基础模型的 32.0 提升至 44.6,Terminal Bench 2.1 由 27.0 提升至 37.1。训练数据同时覆盖代码、视觉和通用任务,用于增强模型跨工具、跨场景完成任务的能力。
当前公开版本是采用 MIT 许可的 SFT 检查点,附带推理说明和聊天模板。小米还开放了配套强化学习任务环境与框架,报告中进一步强化学习后的成绩应与这一可下载版本区分。
上手门槛
自行部署:🟡 中|9B 需要有 16G 以上统一内存(MLX 架构)或 24G 以上显存(CUDA)|35B 需要有 32G 以上统一内存(MLX 架构)或 80G 以上显存(CUDA)
🌐 俄语知识与长文本建模
★ Yandex AliceAI-Foundation-80B-A3B-Base
支持约 256K 上下文,为俄语知识、代码与推理任务提供可继续训练的模型权重。
Yandex 开放 AliceAI-Foundation-80B-A3B-Base。这款从头训练的语言模型拥有 80B 总参数,每个 token 激活约 3B 参数,支持最长 262,144 token 上下文。模型结合线性注意力、门控注意力与混合专家层,覆盖数学、代码和推理任务,官方尤其强调其俄语事实知识能力。
模型权重以 Apache 2.0 许可开放,团队同步发布面向俄语语境的 WikiWebFacts、HardMultiQA 事实评测及评估方法,便于开发者检查知识表现并开展后续研究。
此次提供的是预训练基础模型,适合继续训练和领域适配,构建对话助手仍需相应的后训练。部署时需要加载完整模型权重,不能仅凭 3B 激活参数将其视为小模型;长上下文还会增加运行时的内存开销。
上手门槛
自行部署:🔴 极高|需加载 80B 总权重|完整精度推理面向大显存、多卡环境
🛠️ 编程智能体
★ White Circle GLM-4.7-Flash-Coder
通过软件工程任务微调,增强代码修改与并行工具调用能力,减少任务交互轮次。
White Circle 发布 GLM-4.7-Flash-Coder,基于 GLM-4.7-Flash 对编程智能体能力进行监督微调,开放模型权重和训练数据。团队使用 GLM-5.1 生成软件工程任务轨迹,筛选出 7,777 条通过测试的多轮记录,让模型学习读取代码、修改文件、运行命令和检查结果的过程。
项目方报告,这款 30B 混合专家模型在其 SWE-rebench-V2 评测中的成绩从 33.15% 提升至 41.65%,任务交互轮次减少约 45%,推理成本降低约 14%。改进包括更充分的推理和更集中的工具调用,例如在一轮中读取多个文件,减少完成任务所需的往返。
模型采用 MIT 许可,可下载后接入编程智能体开展测试。它是 White Circle 发布的第三方微调版本,评测成绩对应团队所用的工具与任务环境,迁移到其他智能体框架时仍需验证实际效果。
上手门槛
自行部署:🔴 高|30B 模型完整精度运行需要大显存|执行编程任务需接入文件与终端工具