腾讯开源AuK语音生成与编辑模型,上海AI实验室发布Intern-S2 正式版科学推理模型
原创 每日发现最新 2026-09-15 18:31 中国香港
语音生成与编辑模型腾讯AuK / AuK-Flash,科学推理模型Intern-S2-397B,搜索Agent Iris-mini / Iris-pro,多模态理解模型Agnes-3.0-Flash Preview,图原生事务数据库阿里巴巴NeuG,Agent经验学习框架RSIAgent。
9 月 15 日,今天关注的项目覆盖语音编辑、科学推理、多模态理解与 Agent 开发:腾讯 AuK 扩展本地推理支持,Intern-S2-397B 正式版开放模型权重,NeuG 将图关系、语义和关键词检索整合到同一份数据上。
🎙️ 语音生成与编辑
★ 腾讯 AuK / AuK-Flash
用自然语言生成语音、修改台词和情绪,并完成降噪、人声提取与声音分离。
腾讯 AuK 将语音生成和编辑放进统一的指令接口:既可以根据声音描述生成台词,也可以输入一段录音,要求替换其中的内容、调整情绪和语速,或保留指定说话人的声音。项目已开放代码与权重,提供 AuK 和 AuK-Flash 两个版本,后者采用固定 4 步生成,面向更快的推理。
本轮值得关注的是部署更新:继 9 月 9 日开放项目后,官方在 9 月 13 日增加了 Apple Silicon 的 MLX 推理分支,以及 CUDA 推理的 CPU 卸载功能。开发者可以通过 Python 接口、命令行或 ComfyUI 工作流,将语音处理能力接入现有制作流程。
需要区分模型本体与完整推理链:AuK 的生成模型为 1.5B,但运行时还需要编码器与 VAE。官方在 A800 上的短音频测试中,开启 CPU 卸载后的显存分配峰值约为 17 GiB;这是特定测试条件下的结果,不是所有音频长度的最低配置。
上手门槛
开发接入:🟢 较低|提供 Python 接口和 ComfyUI 工作流
自行部署:🟡 中|需组合语音模型、编码器与 VAE|支持 CUDA CPU 卸载及 Apple Silicon MLX 分支
🔬 科学推理
★ Intern-S2 正式版
结合科学文献的文字与视觉信息,支持科学问题求解和需要持续调用工具的长任务。
上海人工智能实验室开放 Intern-S2 正式版模型权重。此次收录的是不带 Preview 后缀的正式版,面向科学智能与长程 Agent 任务,官方同时提供部署说明和工具调用示例。
其预训练方法强调直接从科学文献原始页面学习,将文字、符号与视觉关系放在一起建模,减少中间解析对页面信息的割裂。在此基础上,模型结合多任务强化学习与长程 Agent 强化学习,面向需要理解材料、组织推理并与外部工具交互的工作。
官方支持 LMDeploy、vLLM 和 SGLang,项目采用 Apache 2.0 许可证。部署上仍需按 397B 级模型规划资源:官方 vLLM 服务示例采用8 卡张量并行,适合已有大型模型基础设施的团队。
上手门槛
自行部署:🔴 极高|397B 级模型|官方提供 8 卡并行服务示例
🔎 搜索 Agent
★ Iris-mini / Iris-pro
自主决定搜索什么、如何阅读结果,以及何时继续调查或结束搜索。
AllSpark Research 的 Iris 面向需要多轮调查的搜索任务,提供 Iris-mini 和 Iris-pro 两个开放权重版本,分别基于 Qwen3.6-35B-A3B 与 Qwen3.5-397B-A17B 进行后训练。训练目标覆盖从提出搜索请求、阅读返回内容,到判断证据是否足够的完整过程。
除模型权重外,项目还公开了 Iris-Harness,包含 Agent 循环、工具、上下文管理策略和评测流程。官方报告中,Iris-mini 与 Iris-pro 的 BrowseComp 成绩分别为 82.2 和 88.6;这些成绩使用指定的上下文管理设置,反映模型与执行框架的组合表现。
当前开放范围包括模型权重和评测框架,数据构建与训练流程尚待发布。部署时也不能只看 3B、17B 的激活参数:两个版本的总参数分别为 35B、397B,还需要配套搜索工具与模型服务。
上手门槛
自行部署:🔴 高(mini)/🔴 极高(pro)|总参数分别为 35B、397B|搜索工具与模型服务需配套部署
👁️ 多模态理解
★ Agnes-3.0-Flash Preview
理解文字、图像与视频,支持工具调用和可调推理强度,开放 33B 预览版权重。
Agnes-3.0-Flash Preview 是一款开放权重的多模态模型,具备 262,144 Token 上下文,支持图像和视频输入、工具调用,以及不同强度的推理模式。开发者可以根据任务需要选择推理强度,或关闭思考模式。
这里需要特别区分版本:仓库最初以 Agnes-3.0-Flash 命名,官方模型卡现已明确它属于较早的 Preview 检查点,与线上生产/API 版本不同。线上版本的 1M 上下文配置和评测成绩,不能用于描述这份开放权重。
模型采用 Apache 2.0 许可证,并提供配套实现与推理示例。官方 BF16 部署路径使用单张 H100 80GB 或 H200;因此,33B 的参数规模仍对应数据中心级显存需求,长上下文使用还需预留额外空间。
上手门槛
自行部署:🔴 高|官方 BF16 路径为单张 H100 80GB 或 H200|需要配套自定义模型实现
🗂️ Agent 数据检索
★ 阿里巴巴 NeuG
在同一份数据上完成图关系查询、向量相似度检索与关键词搜索。
NeuG 是面向 Agent 应用的图原生事务数据库,可嵌入应用进程,也可作为服务运行。官方 9 月更新列出了 v0.2 的三项能力:HNSW 向量搜索、BM25 全文搜索和显式事务,让结构关系、语义相似度与准确关键词能够围绕同一份数据进行查询。
例如,运维 Agent 可以先沿服务依赖关系找到相关手册,再检索与故障描述语义相近的内容,最后用错误码定位具体段落。NeuG 将这些检索方式放到共同的数据基础上,并让图数据与索引变更原子提交,减少多套存储之间保持一致的工作。
项目采用 Apache 2.0 许可证,提供 Python 接口、Cypher 查询及安装包。它适合知识检索、关系分析和 Agent 数据层建设;向量生成与上层 Agent 逻辑仍需由应用侧配套实现。
上手门槛
开发接入:🟢 较低|提供 Python 接口与 Cypher 查询
自行部署:🟢 低|支持嵌入式运行|Windows 通过 WSL2 使用
项目与使用说明:https://github.com/alibaba/neug
🧠 Agent 经验学习
★ RSIAgent
通过自主探索、执行验证和持久记忆,让 Agent 积累陌生软件环境中的操作经验。
AetherLabsAI 开放了 RSIAgent,一套无需更新模型参数的多 Agent 框架。它先安排多样化任务,让 Agent 广泛熟悉环境,再针对难点、隐藏约束和失败案例深入练习,把经过验证的操作步骤、脚本与失败教训保存为可复用记忆。
框架由三个角色协作:Curriculum Agent 选择探索任务,Actor Agent 操作软件并整理经验,Verifier Agent 根据实际执行结果进行检查。后续任务使用已经积累的记忆;在测试阶段,模型参数和记忆均保持固定。
项目采用 Apache 2.0 许可证,目前提供 OSWorld 与 Agents’ Last Exam 的集成,适合研究软件操作 Agent 如何从环境经验中改善表现。它仍需要配套模型服务与任务环境;官方也指出,验证遗漏和错误记忆可能限制改进效果,不能把“自我改进”理解为每轮都能稳定提升。
上手门槛
开发接入:🟡 中|需对接任务环境及模型服务|当前提供 OSWorld 与 ALE 集成