谷歌于9月23日宣布,Gemini系列新增两款文本转语音模型,将语音生成从静态预设转化为动态创意工具,助力创作者、开发者和企业打造更丰富、表现力更强的音频体验,同时优化Gemini Notebook和Google Vids等产品的用户感受。
两款新模型分别为Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS,定位各有侧重:
用户可从原有的30种原始语音扩展至无限语音库。该模型的具体功能包括:
选择声音后,两款TTS模型都能让用户精确控制每一行台词的演绎方式:
性能方面,Gemini 3.8 Flash TTS在Hume AI语音设计基准测试中(71.4分)位居第一,在口音建模方面(60.8分)也领先。
Gemini 3.8 Flash TTS和Gemini 3.8 Flash-Lite TTS能在不牺牲可靠性的前提下实现富有表现力的性能,在Hume AI整体质量指数中分别占据第一和第二,与Gemini 3.1 Flash TTS相比,在长格式内容和双扬声器剧本控制等广泛用例中均有重大改进。
在Voice Arena的盲法人类偏好评估中,Gemini 3.8 Flash和Flash-Lite TTS在全球主要语言(日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语)竞争对手中领先。凭借对100多种语言的支持,这些模型能帮助创作者、开发者和企业在全球范围内打造高质量的多语言语音体验。
谷歌在语音创建和复制功能中内置了严格保护措施,以保护语音人才、尊重身份并确保内容透明度。对于语音复制,系统利用同意验证:用户必须提供来自语音所有者的口头同意记录,与参考说话者匹配后才能创建语音。
Gemini Audio模型生成的每个音频片段都带有SynthID水印,且难以察觉,被直接编织到音频输出中,确保可检测到AI生成的语音,帮助防止错误信息。
即日起,开发者可在Google AI Studio中体验这些新语音生成功能。用户可通过提示从零创建全新声音身份,或复制自己的声音,然后将其直接带入双扬声器剧本编辑器,逐行指导交付。
两款模型已向开发者推送,可在Gemini API和Google AI Studio中使用;面向企业用户,很快将通过Gemini Enterprise中的API推出;面向所有用户,Gemini 3.8 Flash TTS可在Gemini Notebook中使用,Gemini 3.8 Flash-Lite TTS可在Google Vids中使用。需要注意的是,通过AI Studio进行的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。此外,AYX中国也将持续关注这类技术创新在本地化应用中的潜力。
爱游戏注册以爱游戏注册为核心,带来高效便捷的体验。