太初开源ZDTaichu5.0-9B空间理解模型,Anthropic合并Claude Cowork与聊天并推出Docs、Slides
原创 每日发现最新 2026-09-17 18:19 中国香港
多模态与空间理解模型ZDTaichu5.0-9B,文档与办公协作功能Claude Docs / Slides,浏览器自动化工具腾讯BrowserSkill 0.3.0,结构化数据建模模型LimiX-2,实时语音识别模型网易有道Confucius4-R2T2。
9 月 17 日,今天关注的项目覆盖空间理解、办公协作、浏览器自动化、结构化数据建模与实时语音识别:Claude 将文档、幻灯片和长任务整合进对话,腾讯 BrowserSkill 0.3.0 扩展浏览器操作能力,LimiX-2 开放面向表格数据的模型权重与推理代码。
👁️ 多模态与空间理解
★ ZDTaichu5.0-9B
理解图文、视频与多视角空间关系,为工具调用和具身任务提供视觉推理能力。
太初团队近期开放 ZDTaichu5.0-9B。模型结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器,支持文本、单张或多张图片以及视频输入,覆盖文档、图表、OCR 和视觉问答等任务。
空间推理是它的重点方向,包括细粒度位置关系、多视角关联、三维场景理解和视角变换。结合多轮工具使用能力,模型可用于需要持续观察、判断和规划的应用;具身部分主要面向高层场景理解与任务规划,接入具体机器人仍需额外适配。
官方已提供权重、本地推理示例和适配的 vLLM 服务镜像。代码与模型权重的许可证不同:仓库自有代码采用 Apache 2.0,模型权重适用 NVIDIA Open Model License Agreement,使用时应分别核对。
上手门槛
自行部署:🟡 中|提供单卡服务示例|服务部署需使用官方适配的 vLLM 镜像
📄 文档与办公协作
★ Claude Docs / Slides:Cowork 与聊天合并
在同一段对话中完成资料处理、文档撰写与幻灯片制作,并继续编辑和分享成果。
Anthropic 于 9 月 16 日宣布,将 Claude Cowork 与聊天合并,同时推出 Claude Docs、Claude Slides,并把 Claude Design 接入对话。用户可以直接提出任务,由 Claude 判断需要回答问题,还是继续执行资料整理、报告撰写等较长流程。
Docs 用于协作撰写和修改文档,Slides 用于生成、调整与演示幻灯片,并支持下载为 PowerPoint 或 PDF。报告和演示稿可以共享同一段对话中的背景、技能与连接器,减少在不同工作区之间搬运资料的步骤;云端任务也能在用户合上电脑后继续运行。
功能仍在分批上线。统一体验先面向 Pro 和 Max 用户,在未来数周逐步推出;Docs、Slides 和对话内 Design 以 Beta 形式面向付费计划开放,企业管理员可决定启用时间。
上手门槛
在线使用:🟡 中|Docs / Slides 为付费计划 Beta|统一体验先向 Pro、Max 分批开放
使用入口:https://claude.ai/
🌐 浏览器自动化
★ 腾讯 BrowserSkill 0.3.0
让 AI Agent 复用真实浏览器的登录状态,完成网页操作、截图和后台任务。
腾讯 BrowserSkill 的 CLI 0.3.0 于 9 月 17 日发布,配套扩展版此前一天发布。项目通过命令行工具和浏览器扩展,将能执行命令的 Agent 接入用户日常使用的浏览器,复用已有登录状态,减少为自动化任务重新配置账号的步骤。
这一版本新增经过认证的远程网关、后台任务标签页、整页截图和本地任务执行历史,并扩展 Canvas 区域的识别、截图及点选能力。对表单、跨页面流程和图形界面操作来说,这些更新补充了单纯读取网页文本之外的交互手段。
BrowserSkill 不绑定单一 Agent,已提供面向多种编程助手的安装与技能配置方式,支持 Chrome 和 Edge。项目采用 MIT 许可证;浏览器操作能力在本地运行,所连接 Agent 使用的模型服务仍需另行准备。
上手门槛
开发接入:🟢 较低|官方提供安装引导|需配套浏览器扩展与可执行命令的 Agent
📊 结构化数据建模
★ LimiX-2
用一个 400M 预训练模型处理表格分类、数值预测和缺失值填补,无需逐任务微调。
稳准智能于 9 月 16 日发布 LimiX-2 权重与推理代码。新模型扩展至 400M 参数,面向结构化数据中的分类、回归与缺失值填补任务,通过提供上下文样本完成预测,无需为每个新任务单独更新模型参数。
LimiX-2 尝试联合建模特征与目标之间的数据关系,并利用结构因果模型生成的合成数据进行预训练。项目方报告,它在 TabArena、TALENT 和 BCCO 评测中取得较强表现。对需要处理多种表格任务的团队,这提供了统一模型和接口的选择。
官方提供命令行与 Python 推理入口,支持本地运行。LimiX-2 权重采用非商业许可证,代码另有包含署名与命名要求的许可条款,不能直接套用旧版本的 Apache 2.0 描述。实际资源需求还会随数据规模和推理配置变化。
上手门槛
自行部署:🟢 较低|400M 模型,提供本地推理接口|权重限非商业用途
🎙️ 实时语音识别
★ 网易有道 Confucius4-R2T2
把实时语音持续转成稳定文本,已提交内容不回改,便于字幕和语音 Agent 立即使用。
网易有道近期开放 Confucius4-R2T2 权重与推理代码。模型基于 Qwen3-ASR-1.7B,面向实时转写场景,重点解决流式识别中已经出现的文字反复修改、影响下游处理的问题。
它通过稳定前缀学习,判断哪些内容可以立即提交、哪些还需要等待更多音频。提交后的文本只追加、不回改,因此字幕系统可以减少闪烁,语音 Agent 也能更早消费稳定的识别结果。官方支持配置 80 毫秒至 2 秒的音频分块;分块时长不等于完整转写的端到端延迟。
项目提供离线与流式推理示例,以及实时服务和客户端代码,重点优化中英文识别。代码采用 Apache 2.0,权重采用网易模型使用协议:达到协议规定的用户或营收规模需另行授权,用于改进其他模型也有额外限制。
上手门槛
自行部署:🟢 较低|基于 1.7B 语音模型|提供离线与流式推理示例
开发接入:🟡 中|提供实时服务与客户端代码|接入应用需处理音频流和会话状态