阿里云百炼上线Qwen-Audio-3.1系列语音模型,Google发布Gemini 3.8 Flash TTS与Flash-Lite TTS
原创 每日发现最新 2026-09-24 18:41 中国香港
语音生成与交互模型Qwen-Audio-3.1系列,语音合成模型Gemini 3.8 Flash TTS / Flash-Lite TTS,文档识别与解析模型TeleOCR,文档解析模型Jina-OCR-v1,桌面智能体Goose v1.52.0。
9 月 24 日,今天关注的项目覆盖语音生成、文档解析与桌面 Agent:Qwen-Audio-3.1 扩展音频创作与实时交互,Gemini 推出支持角色声音设计的语音合成模型,Goose 新增桌面实时语音对话,并补充 TeleOCR 与 Jina-OCR-v1 两款文档解析模型。
🎙️ 语音生成与交互
★ Qwen-Audio-3.1 系列
覆盖语音识别、声音生成与实时对话,将对白、音效和环境声整合到音频创作中。
Qwen-Audio-3.1 系列已在阿里云百炼提供调用入口,覆盖录音转写、流式识别、语音合成和实时语音交互。开发者可以按任务选择模型,将语音能力接入会议记录、内容制作或语音助手。
其中,TTS-Next 可以在一次生成中组合人声、音效与环境声,适合多人对白、播客和影视游戏音频。当前调用文档列出的语言为中文和英文,播客单次最长 4 分钟,其他场景最长 2 分钟;还可加入参考音频,帮助保持角色声音的一致性。
Realtime-Plus 面向双向实时语音对话,支持文字与音频输入输出、声音克隆和工具调用,可将对话连接到业务操作。它也提供联网搜索,但联网搜索与 Function Calling 不能同时开启,接入时需要按工作流选择。上述能力通过云端 API 提供。
上手门槛
开发接入:🟢 较低|通过百炼 API 调用|实时对话需对接 WebSocket|API Key 与服务地域需匹配
★ Gemini 3.8 Flash TTS / Flash-Lite TTS
用自然语言设计角色声音,逐句控制语气、节奏与双人对白,兼顾创作和批量合成。
Google 发布 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,并开始通过 Gemini API 与 Google AI Studio 提供服务。Flash 侧重角色声音设计与精细表演控制,Flash-Lite 侧重大规模、成本敏感的语音生成,分别面向游戏角色、有声读物、批量配音和语音助手等场景。
Flash 可以根据自然语言描述创建声音,指定角色、口音与音色特征。两个版本均支持逐句安排语气和节奏,以及双人对白的轮流发言,还能在脚本中加入笑声、叹气等非语言表达,让生成结果更接近有表演指示的配音。
官方还提供基于 30 秒参考音频的声音复刻,要求提交与参考说话人匹配的口头授权录音。声音复刻在部分地区不可用;声音再混合功能仍标注为即将推出。
上手门槛
在线使用:🟡 中|通过 Google AI Studio 体验|受服务地区限制|声音复刻另有地区限制
开发接入:🟡 中|通过 Gemini API 调用|需受支持地区的服务访问权限与 API Key
发布说明:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speech/
📄 文档识别与解析
★ TeleOCR
用约 1.2B 参数统一解析电子文档与拍摄页面,处理文字、表格、公式及弯曲版面。
TeleOCR 是面向文档理解的轻量视觉语言模型,约有 1.2B 参数,同时处理规整的电子文档和相机拍摄的页面。项目此前名为 NaviDC-OCR,已于 9 月 10 日更名为 TeleOCR,目前提供模型权重与批量推理代码。
它关注拍照文档中的几何变形,可在不额外使用展平模型的情况下,直接进行版面与内容解析。对于弯曲纸张、倾斜页面和较复杂的表格公式,模型尝试同时恢复内容与结构,适合纸质资料数字化、扫描件整理及知识库预处理。
项目方报告其在 OmniDocBench v1.6 上取得 96.87 的综合分数。官方提供检测与分割两种版面处理模式,并建议真实退化文档采用分割模式。模型权重标注 Apache 2.0 许可,部署时可按文档类型调整处理方式。
上手门槛
自行部署:🟢 较低|约 1.2B 权重已开放|提供 vLLM 批量推理脚本|官方 GPU 路径使用 CUDA
★ Jina-OCR-v1
把文档页面转换为保持阅读顺序的 Markdown,并通过推测解码提高批量解析效率。
Jina-OCR-v1 基于 DeepSeek-OCR 构建,采用 3B 级 MoE 解码器,每个 Token 约激活 570M 参数,面向文档图像的端到端解析。默认输出保持自然阅读顺序的 Markdown,也可按提示将公式转为 LaTeX、表格转为 HTML,便于后续检索与文档处理。
模型加入 FastMTP 推测解码,提前生成候选文字并交由主模型验证。官方在单张 A100、并发 32 的 olmOCR-Bench 测试中报告 2.57 页/秒。这一吞吐量对应特定批量测试条件;FastMTP 由 vLLM 路径提供,普通 Transformers 推理不包含该加速。
开发者可以使用 Jina Reader、兼容 OpenAI 格式的 API,或下载权重自行运行。公开权重采用 CC BY-NC 4.0,仅允许非商业使用;商业使用需另行联系授权。托管服务与下载权重是不同使用路径,应分别核对服务计费和授权条件。
上手门槛
在线使用:🟢 低|官方 Playground 可上传文档|使用 Jina API Key
开发接入:🟢 低|提供 OpenAI 兼容接口与 Reader API|需 API Key
自行部署:🟢 较低|提供 Transformers 与 vLLM 示例|加速推理需使用官方适配脚本|商业用途另行授权
Reader 接入:https://jina.ai/reader/
🛠️ 桌面智能体
★ Goose v1.52.0
在桌面 Agent 中加入实时语音对话,并扩展模型服务与决策能力接入。
Goose 发布 v1.52.0,为桌面应用加入实时语音对话。这个可扩展 Agent 能结合配置的模型与工具执行命令、编辑文件和运行测试,本次更新为用户与 Agent 沟通增加了语音入口。
新版本还加入支持 OpenRouter 和 Jev 的决策服务组件,新增 Z.AI Coding Plan 接入及流式工具调用,并适配 Claude Opus 5.5、GPT-6 Sol 和 GPT-6 Luna。对开发者而言,更新重点是扩展 Agent 可连接的服务,以及处理任务时的交互方式。
Goose 提供桌面应用与源码,可按任务配置模型和扩展。所用模型、语音服务的账号权限与费用需按实际配置单独准备,客户端本身不会自动提供这些服务额度。
上手门槛
开发接入:🟢 较低|提供桌面应用与 CLI|需配置模型服务及工具权限