Gemini 3.8 Live 语音模型与浏览器实时对话界面

Simon Willison1 天前

Google 发布了 Gemini 3.8 LiveGemini 3.8 Live Extended Thinking,这是两款新的语音到语音模型,形态上接近 OpenAI 的 GPT-Live 系列。

围绕这两款模型,有开发者基于官方文档制作了一个浏览器端 Web UI,用于快速试用 Gemini Live 的实时语音能力。

这个界面能做什么

该 Web UI 支持以下功能:

  • 选择不同的 Gemini Live 模型
  • 选择语音预设
  • 输入可选的系统提示词
  • 通过浏览器开启语音对话
  • 在模型说话时直接打断回复
  • 查看对话转录文本
  • 下载或清空转录记录
  • 通过文本输入发送消息,并中断当前语音回复

界面示例中,用户可以先开始会话,浏览器会请求麦克风权限。会话状态会显示为正在监听,并提供麦克风音量指示与计时器。

转录内容中也会标记被打断的模型回复。例如,当模型正在介绍加州褐鹈鹕时,用户可以中途要求“换一些不同的事实”,模型会停止当前回复并继续新的回答。

技术实现

这个实现没有使用额外库,主要依赖浏览器原生能力:

  • 使用 WebSocket 连接 Gemini Live 的双向生成接口
  • 使用 Web Audio API 的 AudioContext 处理音频采集与播放

其连接的 WebSocket 端点形如:

wss://generativelanguage.googleapis.com/ws/google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent?key=...

也就是说,浏览器端可以直接通过 WebSocket 与 Gemini Live API 建立双向音频通信,同时用 Web Audio API 管理麦克风输入和模型语音输出。

值得关注的点

这类工具展示了实时语音模型在浏览器中的一种轻量集成方式:不依赖复杂前端框架,也不需要专门的原生应用,就可以完成实时语音对话、播放、录音、打断和转录展示。

对于想实验语音代理、浏览器 AI 助手或实时客服原型的开发者来说,这种实现方式有参考价值。

评论

请登录后发表观点

暂无数据