2026 年 8 月 26 日至 27 日,Google 连续发布 Gemini Omni 1.1 Flash 视频生成模型 GA 版本与 Gemini 3.5 Transcribe 语音模型。这两款模型直接剥离了过去追求炫技的演示感,塞满了诸如草稿渲染、首尾帧控制和口语自纠错等枯燥但极具实效的工程细节。多模态模型的演进方向发生偏移,工程化集成能力成为衡量新一代模型的首要标尺。
视频生成剥离盲盒属性
Gemini Omni 1.1 Flash 将场景扩展能力拉升至 40 秒,并在生成过程中支持分析前置至多 10 秒的上下文。这说明长程视频生成已经跨越了单次盲抽的节点,创作者可以通过上下文增量续写来维持叙事的连贯性。
更符合工业标准的设计体现在成本拆分上。新模型提供了 360p 的草稿模式,生成速度比 720p 快 60%,成本仅为标准流程的三分之一,后续可以再 upscale 至 1080p 或 4K 交付。单次生成的整体流程被明确切割为快速原型迭代与高精度最终渲染两步。在标准收费 $0.10/秒的标价下,这种分层渲染机制极大拉低了商业项目试错阶段的试错成本。
首尾关键帧的控制与最多 3 秒的参考视频输入,强制收束了模型自由发散的概率。创作者可以直接指定起止画面,要求模型完成复杂运镜或无缝循环过渡。视频生成的随机性被这些硬性参数框定在了可预期的执行边界内。
图:Gemini Omni 1.1 Flash 主视觉。来源:Google
图:Gemini Omni 1.1 Flash 定价表,标准价格 $0.10/s。来源:Google
语音转写跨越人工校验阈值
在语音模态,Gemini 3.5 Transcribe 被直接定位为输出整洁文本的工具。它的非流式单词错误率(WER)压低到了 2.6%,在包含顶级语言集的 FLEURS 基准测试中,其流式与非流式精度均优于前代 Chirp 3 模型。这种精度的本质意义在于将人工校对环节从日常会议与通话记录的后处理管线中彻底摘除。
该模型原生自带了口语自纠错与填充词删除机制。它会自动把冗余停顿与修正发音转化为干净的最终文本,让语音与键盘同级,成为一种高保真的输入界面。其最终转写时间比 Chirp 3 缩减了 70%,这种亚秒级的流式响应延迟让它能直接嵌入 Android Gboard 的 Rambler 功能与 AI Studio 的 Build mode 中。
图:Gemini 3.5 Transcribe 主视觉。来源:Google
图:FLEURS 流式语音识别精度对比图。来源:Google
图:FLEURS 非流式语音识别精度对比图。来源:Google
生态镶嵌与劳动力议价博弈
在产品面,LiveKit、Vercel 等 7 个开发平台完成了对 3.5 Transcribe 的首批接入。通过统一处理文本、音频与视频的 Interactions API,Gemini 正在将自身降级为无处不在的系统层基础设施。它将静默存在于 macOS 的系统级应用调用和即将上线的 Chrome 全局网页听写输入框中,由下游开发者完成具体场景的拼接。
在 Hacker News 的讨论区中,对技术效率的惊叹伴随着对创意工作者议价权的现实讨论。好莱坞演员公会(SAG-AFTRA)的条款已经将底线设定在知情同意上,全面禁止的诉求在产业端并不现实。这种被动妥协反映出生成 AI 深度融入工业管线后的不可逆趋势,也与程序员群体面对代码被蒸馏进模型权重时的处境形成了镜像对照。
这两款模型的发布证明生成式 AI 的竞争逻辑已经转轨。无论是让视频生成具备草稿迭代能力,还是让语音转写直接产出结构化文本,生成模型的任务核心已发生位移。当大模型按生产工具的标准设计时,如何将它们低阻力地塞进真实世界的制造流程,构成了下一阶段的核心竞争壁垒。
参考链接:
- Google 官方博客:Build with Gemini Omni 1.1 Flash
- Google 官方博客:Gemini 3.5 Transcribe
- Hacker News 讨论 (49467922)