AI Pulse

Gemini看视频不再固定抽帧,token消耗最高降88%

Gemini看视频不再固定抽帧,token消耗最高降88%

Gemini 看视频的方式变了。以前是固定每秒抽 1 帧,整段素材一个待遇,帧率得靠 API 自己调。今天发布的新功能叫 agentic video understanding。模型自己决定看哪里、看多快,也自己选模态:画面、音频还是字幕。只取需要的时刻和信号。

背后是模型推理和原生视频工具的组合。Gemini 通过 agentic loop 调用内部工具,加载视频里相关的片段。开发者以前也能手动做类似的事,现在内置了,省掉大量开发工作。

数字上很直接:token 消耗最高降 88%,成本最高降 66%,准确率最高提升 7%。长视频收益最明显,10 分钟的教程、90 分钟的讲座、好几个小时的录音都覆盖到了。

具体能力分四块。

定位瞬间状态变化。1 FPS 抽帧容易漏掉的亚秒级变化和剪辑边界,现在能抓到,自动视频编辑更精确。

大海捞针。几小时的视频里回答复杂查询,不用烧掉几百万 token。

查异常。对感兴趣的时间窗口用更高帧率重新采样,快速运动和细微视觉伪影都能看清。

数动作和物体。重复的物理动作、不同时间段里出现的独特物体,都能准确追踪。

三个模型已支持:Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。其中 3.7 Flash 配合新功能整体质量最好,质量-成本组合也最划算。它处在准确率-成本的帕累托前沿。

价格沿用标准 Gemini API token 定价,没有额外功能费。启用就一步:API 配置里把 processing 设为 agentic。今天起开放使用。支持视频上传和 YouTube 视频,开发者通过 Gemini API 就能调。Google AI Studio 和 Gemini Enterprise Agent Platform 都可以用。

接下来还有两步。Gemini 应用里的 Flash 和 Flash-Lite 模型会向所有用户开放。未来几个月,Ask YouTube 也会接入这个功能,在视频观看页面提供基于画面的回答。

早期访问合作伙伴测试表现不错,但具体是哪些、数据如何,官方没有公布。

阅读原文
📚 相关主题 GeminiGoogle

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新