NaiveAI开源Naive-N0.5-Flash编程模型,美团上线LongCat-2.5-Preview多模态模型
原创 每日发现最新 2026-09-28 18:36 中国香港
语音生成与交互模型Qwen-Audio-3.1系列,语音合成模型Gemini 3.8 Flash TTS / Flash-Lite TTS,文档识别与解析模型TeleOCR,文档解析模型Jina-OCR-v1,桌面智能体Goose v1.52.0。
9 月 28 日,本期关注编程模型、多模态决策与模型训练:NaiveAI 开放百万上下文模型 Naive-N0.5-Flash,上海人工智能实验室发布 Intern-Decision 系列,华为补齐 openPangu-2.0 预训练与后训练代码;同时补录 LongCat-2.5-Preview 与 Space Bunny Alpha 的近期上线动态。
💻 编程与多模态模型
★ Naive-N0.5-Flash
面向编程与 AI 研发,采用稀疏注意力处理百万 Token 上下文,开放模型权重与推理代码。
NaiveAI 开放了 Naive-N0.5-Flash 的模型权重与推理代码,采用 MIT 许可证。模型面向编程和 AI 研发任务,采用 MoE 架构,总参数量为 309B,每次激活约 15.5B,原生支持 100 万 Token 上下文。
它基于 MiMo-V2.5 底座改造,将滑动窗口注意力与 DeepSeek 稀疏注意力结合,避免在每一层对全部历史内容执行完整注意力计算。这一设计旨在降低长输入下的计算与访存开销,适合需要持续阅读代码、保留任务上下文的研发工作流。
激活参数较少并不意味着显存需求低。官方说明,FP8 权重约占 315GB,推理还需要额外显存,百万上下文也会增加缓存开销。目前官方仓库明确提供权重部署路径,API 服务仍处于预告状态。
上手门槛
自行部署:🔴 极高|需支持 FP8 的 NVIDIA GPU|权重约 315GB,推理需额外显存
★ LongCat-2.5-Preview
新增图片理解与视觉推理,支持百万上下文,可接入现有编程工具完成代码任务。
美团于 9 月 25 日上线 LongCat-2.5-Preview。本次更新新增图片理解能力,可围绕图像内容完成问答、摘要和复杂视觉推理,同时强化代码生成、代码理解与自动化编程。
官方 API 文档给出的上下文窗口为 100 万 Token,最大输出长度为 128K Token。开发者可以把界面截图与代码一起交给模型,用于界面实现、视觉问题分析和代码修改,也可以在长上下文中组织较完整的项目资料。
接入方面,平台提供兼容 OpenAI 与 Anthropic 的接口,并给出 Claude Code、OpenCode 等工具的配置说明。当前按云端预览服务使用,不能把 API 上线写成模型权重开源;中国大陆用户在充值或购买资源包前,需要完成个人实名认证或企业认证。
上手门槛
开发接入:🟢 低|兼容 OpenAI / Anthropic API|大陆用户充值前需完成认证
★ Space Bunny Alpha
接收文本、图片和视频输入,支持百万上下文与工具调用,目前通过 OpenRouter 免费预览。
Space Bunny Alpha 于 9 月 23 日上线 OpenRouter,是一款开发方暂未公开身份的预览模型。官方页面列出的能力包括编程、原生多模态输入、可调推理强度与 100 万 Token 上下文,当前输入和输出 Token 均免费。
模型可接收文本、图片和视频,并输出文本;接口支持工具调用与 JSON 输出,适合接入编程助手、图文分析和多步骤 Agent 工作流。不过,JSON 输出不等于严格的 JSON Schema 约束,应用仍需校验返回字段。
开发方身份尚未确认,不能将其直接归属为某家公司的新模型。OpenRouter 负责路由请求,并非模型开发者。页面同时说明,服务提供方可能保留提示词和回答,但不用于训练;使用需遵循匿名预览模型条款,不能将其视为开放权重项目。
上手门槛
开发接入:🟢 低|通过 OpenRouter API 调用|当前免费预览,受平台限额约束
🧭 多模态决策
★ Intern-Decision 系列
结合文本与图片,在一次模型计算中完成多个选择、评分或是非判断,并返回候选答案的概率。
上海人工智能实验室开放 Intern-Decision 系列,提供 0.8B、2B、4B 三种规格。模型基于 Qwen3.5 系列进行决策微调,输入包括共享上下文、多个问题及可选图片,输出结构化答案与概率,适合工具选择、任务路由、内容分类和视觉决策。
它直接对给定候选项评分,无需逐字生成自由文本答案。同一请求中的多个字段共享一次前向计算,可以同时判断“交给哪个工具”“优先级是多少”和“是否需要人工处理”,减少在高频决策环节反复调用生成模型的开销。
项目方报告,4B 版本在七组测试中的平均准确率为 90.02%,对照 Jev 为 88.74%;在单张 RTX 4090、289 个输入 Token、三个决策字段的测试条件下,平均本地请求延迟为 44.16 毫秒。这些数字对应特定测试协议,不能直接代表图片任务或实际业务中的表现。
模型权重采用 Apache-2.0,项目同时公开训练、推理、评测与概率校准代码。训练数据及部分私有校准记录未随代码发布;部署时应使用项目提供的决策接口,而非把它当作普通聊天模型调用。
上手门槛
自行部署:🟢 较低|提供专用推理代码|官方已在单张 RTX 4090 上测试三种规格
🛠️ 模型训练
★ openPangu-2.0-Training / openPangu-2.0-RL
开放面向昇腾平台的预训练、监督微调与强化学习代码,补充盘古 2.0 的训练工具链。
华为于 9 月 28 日宣布开放 openPangu-2.0 的预训练、监督微调及后训练强化学习代码。本次更新扩展的是训练环节的开放范围,相关代码分别进入 openPangu-2.0-Training 与 openPangu-2.0-RL 两个仓库。
Training 面向大规模基础模型训练,基于 PyTorch 与 CANN 生态提供预训练和 SFT 代码;RL 则面向昇腾平台与 VERL 生态,提供强化学习后训练相关实现。两者服务于不同训练阶段,可以为已有昇腾算力的团队提供官方实现参考。
两个仓库均标注 Apache-2.0 许可证。对于准备开展领域训练或强化学习后训练的开发者,新增代码有助于了解模型如何在昇腾平台上训练与优化;实际运行仍需相应硬件、模型权重和自有训练数据,代码开放不等于获得完整训练数据集或开箱即用的在线服务。
上手门槛
自行部署:🔴 高|面向昇腾硬件|需准备匹配的模型权重与训练数据