返回热力追踪
关注模型发布

Google DeepMind发布Gemini 3.5 Transcribe高精度语音转文本模型

谷歌DeepMind正式推出Gemini 3.5 Transcribe,定位为目前精度最高的语音转文本模型,专为智能语音交互设计。该模型支持超85种语言,可实现流式与非流式转录,支持多人说话人识别与自定义词汇。

编辑视角

作为头部科技公司推出的垂直语音模型,Gemini 3.5 Transcribe在词错率指标上表现优异,会冲击现有语音转文本开源与商用产品市场,对语音AI开发者和相关厂商有重要参考价值。

深度解读

主旨:谷歌DeepMind官方发布全新语音转文本垂直模型Gemini 3.5 Transcribe,填补Gemini家族在高精度语音转录方向的产品空白。证据:DeepMind官方博客发布公告,官网已列出该模型条目,第三方评测显示其流式与非流式平均词错率分别低至4.0%和2.6%,能力指标突出。边界:本次公开信息未披露模型是否开源、API调用价格与商用授权规则,也未说明是否对所有开发者开放权限,现有信息仅确认模型发布,产品落地细节仍待后续更新。反证:目前没有信息显示该模型会替代通用大模型的语音能力,仅作为垂直场景的专用转录方案推出。后续观察点:该模型的开放进度、商用定价,以及对第三方语音转录服务市场的影响。

核心要点
  • 由Google DeepMind官方发布,是Gemini家族新增语音转文本模型
  • 定位为当前DeepMind精度最高的语音转文本专用模型
  • 支持超85种语言,可识别最多三人说话人,支持自定义词汇
  • 第三方评测显示词错率低,转录精度处于行业高位
延伸阅读
  • Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型来自内部知识库,补充了模型评测指标和功能细节