谷歌推出用于音频转写的 Gemini 3.5 Transcribe AI 模型——The Verge
谷歌更新了 Gemini Audio 产品线,并推出了用于音频转写的新模型 Gemini 3.5 Transcribe。据The Verge报道,该模型将能够自动识别专业术语和超过85种语言、格式化文本,并删除“呃”和“嗯”等口头填充词。
新模型的功能
谷歌表示,与此前的转写模型 Chirp 3 相比,Gemini 3.5 Transcribe 是一项重大进步,尤其体现在多语言处理能力和词语错误率方面。用户可以添加自定义词汇表,以便模型正确处理特殊的单词拼写和专业术语,无需后续人工编辑。
该模型还可以为预先录制的音频中最多三位说话者标注发言归属,并为每个词添加时间戳。谷歌称,该工具支持通过语音编辑文本。
更多最新消息请关注 UA.News Telegram 频道 Telegram.
Gemini Live 更新
除 Transcribe 外,该公司还推出 Gemini 3.5 Live 和 Gemini 3.5 Live Experimental。这些模型进一步发展了 Gemini 语音模式中使用的语音识别技术。Gemini 3.5 Live 应能更好地处理话语中途的打断、识别语言,并实时处理视觉信息。
根据谷歌的描述,Gemini 3.5 Live 的实验版本可以逐步语音说明完成与推理相关的更复杂任务的过程。新功能已开始以英语向 macOS 上 Gemini 应用的用户推出,同时也面向部分国家和语言中 Android 上的 Rambler 听写功能推出。
开发者可通过 AI Studio 和 Antigravity 中的 Gemini API 以公开预览形式使用这些模型。谷歌承诺将在近期加入对 Chrome 的支持。