Google 过去六周发布了三个 Flash 模型,但好像 0 个人在意。


能让谷歌逆风翻盘的AI,可能不是 Gemini


在 AI 狂飙突进的这两年里,Google 似乎总是扮演着那个「起大跑慢」的角色。


能让谷歌逆风翻盘的AI,可能不是 Gemini


老实说,看到 Gemini 在编程和推理上迟迟拿不出让人眼前一亮的成绩时,没人不会觉得 OpenAI 和 Anthropic 已经把身位拉开了。


不过,代码、文本处理,甚至图像生成这些领域的强大模型都会变得非常出色。这只是时间问题而已。


难的是让 AI 理解这个世界本身:包括视频、音频、运动、三维空间、时间和空间关系,以及事物如何相互变化和相互作用。


Google 在 9 月 1 日发布了「主动视频理解」功能,让 AI 判断该盯住哪一段画面,什么时候倒回去重新看一遍,用什么样的方式去看,从而得到更精准的理解。


能让谷歌逆风翻盘的AI,可能不是 Gemini


官方的演示是让模型数掌声的次数,这是过去 AI 很难做好的任务,因为传统方式按固定的每秒 1 帧读取画面,瞬间发生的动作很容易被漏掉或者和别的声音混在一起。而在主动理解模式下,模型能根据需要自动调整处理速度,准确识别并数出每一次鼓掌。


能让谷歌逆风翻盘的AI,可能不是 Gemini


加上 Google 手里握着 YouTube、Maps 和 Search 这类现实世界的数据入口,它对物理世界的触达方式其实相当特别。


告别逐帧试探,让 AI 主动看懂流动的世界


AI 理解视频的方式没那么高端。简单来说,它们是在「看图说话」。


当我们把一段视频喂给传统的 AI 模型时,系统会在后台悄悄把视频切碎,比如按照每秒 1 帧的频率提取静态画面。这种做法在一定程度上解决了计算量过大的问题,但其缺陷也显而易见。


如果视频里出现了一个极其短暂的动作,或者一个在 0.5 秒内闪过的画面,这种粗暴的采样方式就会将其完美错过。


能让谷歌逆风翻盘的AI,可能不是 Gemini


更不用说,当视频长度延伸到几个小时,庞大的帧数会瞬间撑爆模型的上下文窗口,让 AI 陷入记忆错乱的尴尬境地。


Google 给 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型接入「主动视频理解」,思路和此前发布的「主动视觉」有些相似,都是把模型的推理能力和一套原生工具绑在一起,让模型自己去调用。


模型会先形成一个循环式的判断过程,决定接下来要看哪一段、用多快的速度看、依赖画面还是音频还是字幕,然后调用内部工具把对应片段取出来精读。开发者原本也能手动拼出类似的处理逻辑,但需要写不少胶水代码,如今这被模型自己接管了。


能让谷歌逆风翻盘的AI,可能不是 Gemini


根据 Google 官方公布的基准测试,启用主动视频理解之后,token 消耗最多能降低 88%,分析成本最多降低 66%,同时准确率还能提升最多 7%。


能让谷歌逆风翻盘的AI,可能不是 Gemini


Google 在 LongVideoBench 这类长视频理解基准上做了对比,结果显示 Gemini 3.7 Flash 在开启主动理解后,处于准确率与成本的帕累托前沿,是目前测试模型里性价比最好的一个。


有开发者用 Gemini 3.7 Flash 的主动视频理解功能配合 Agora 的对话式 AI 技术,搭建了一套小型演示系统。他们录制了一段视频,对着系统提出问题,模型分析视频片段,数清了手指排列的顺序,并提取出带时间戳的关键时刻,整个过程支持实时语音对话。


能让谷歌逆风翻盘的AI,可能不是 Gemini


像字幕组般贴心 像弹幕般陪伴


「我敢打赌,你或多或少追过字幕组制作过的剧。那时,白字蓝边、悬浮在片子底部的中英字幕,是我们探索另外一个世界的通道。」


字幕组很擅长为国内观众提供文化背景解释。


比如在《生活大爆炸》第四季第二集中,剧中角色提及了斯蒂夫·沃兹尼亚克,他在美国或许是个家喻户晓的人物,但对国内观众来说却较为陌生,于是中文字幕里用括号标注出了此人为苹果公司创始人之一。


能让谷歌逆风翻盘的AI,可能不是 Gemini


@ConcordeSky 在翻译《伟大的旅程》的一集特辑中,把镜头里所有出现的飞机全部考证清楚型号,在字幕里做出注释。


现在,AI 也可以像字幕组般贴心地在你观看过程中弹出有趣的事实。


能让谷歌逆风翻盘的AI,可能不是 Gemini


可以想象你正在观看一场节奏极快的 NBA 季后赛或是欧洲杯足球赛。


对于普通观众而言,赛场上的战术配合往往是一眨眼就错过的模糊画面,我们只能跟随着解说员的惊呼去感受比赛的激情。


但是,当启用了 Gemini 主动视频理解功能的播放器介入时,观赛体验将会发生颠覆性的改变。


能让谷歌逆风翻盘的AI,可能不是 Gemini


在直播或录播的过程中,AI 会在后台以极高的灵敏度实时分析着场上的局势、攻防两端的战术阵型以及每一个球员的跑位。


当赛场上突然出现一次精妙绝伦的反跑空切,或者是针对防守漏洞的战术犯规时,屏幕边缘会自然、克制地弹出战术拆解画面。


动态的战术路线图会自动在球员脚下延伸,同时拉出该球员在类似位置的历史投篮热力图和数据对比。如果遇到争议判罚,AI 甚至会结合当下最新的规则条款给出即时的视觉解释。


在这项技术的加持下,屏幕前不再只是一个被动接受画面的观众,每个人的身边都仿佛坐着一位不知疲倦、数据详实的专业场边战术分析师。


如今许多家庭都会安装智能摄像头来照看家中的幼儿或宠物,然而现有的摄像头报警功能常常闹笑话。一阵风吹动了窗帘,或者是光影发生了微小的变化,手机就会频繁收到「检测到画面异动」的无用推送。


能让谷歌逆风翻盘的AI,可能不是 Gemini


连接了 Gemini 的家庭监控系统将完全不同。得益于其对复杂动态场景的理解能力,AI 能够轻易过滤掉那些由风吹草动、光影变幻产生的无效运动噪点。它的注意力始终聚焦在具有语义价值的实体上。


当一个牙牙学语的幼儿试图攀爬客厅里高处的置物架,或者当家里的猫咪在角落里呈现出反常的、长期的蜷缩状态时,它会向监护人的手机推送一条带有精准场景语义的预警:「宝宝正在尝试攀爬书柜,请注意安全」或者是「猫咪已持续萎靡不振超过两小时,建议观察健康状况」。


当 YouTube 拥有了眼睛,视频消费的下半场


这项能力目前已经能通过 Google  AI Studio 和 Gemini Enterprise Agent Platform 里的 Gemini API 调用,支持上传视频和 YouTube 视频两种输入,定价沿用标准的 token 计费,没有额外收费。


能让谷歌逆风翻盘的AI,可能不是 Gemini


Google 表示,这项能力很快会推送给 Gemini App 里使用 Flash 和 Flash-Lite 系列模型的所有用户,未来几个月还会为 YouTube 的「Ask YouTube」功能提供支持。


顺带一提,拥有 5 亿订阅者的 YouTuber MrBeast 在即将发布的视频中,将会介绍 Gemini、Google Health 以及 Fitbit Air 等产品。这是他与 Google 多年合作计划的一部分,他会在穿越丛林、沙漠和北极地区时借助 Gemini 辅助工具来识别危险、应对恶劣的天气条件。


能让谷歌逆风翻盘的AI,可能不是 Gemini


在以往,我们与视频的交互是单向且线性的。你点开一个两小时的数码评测视频,想要寻找关于某款手机屏幕亮度的真实表现,你只能在进度条上反复拖拽,或者依赖其他热心网友在评论区留下的时间戳或课代表式总结。


当「Ask YouTube」成为标配,用户与视频之间的墙被彻底推倒。


你可以在播放页面随时敲下你的疑问:「主讲人在哪个时间段对比了这款手机在阳光下的显示效果?他们的结论是什么?」或者在一段长达数个多小时的烹饪教学视频里直接提问:「配料表里提到的迷迭香是在第几步放进去的?需要腌制多久?」


AI 会在瞬间检索整部视频,精准地将进度条定位到那一帧,同时在侧边栏用简洁流畅的语言为你总结出答案。


互联网上海量的视频资源,将在这一刻转化为可以直接被调用的结构化知识库。


眼下看,Google 在短时间内是很难回到旗舰模型第一梯队了,但如果真正决定胜负的是谁能造出理解世界、并且能和世界互动的 AI,那么这场比赛可能才刚刚开始重新洗牌。


未来的 AI 不仅仅会听、会说、会画,更能够用一双真正懂温度、懂逻辑的眼睛,和我们一起凝视这个瞬息万变的世界。


相关参考🖊️:

https://mp.weixin.qq.com/s/eIWgS38EFHS-YF48GFf98Q

https://mp.weixin.qq.com/s/fILhstpTYGYsNqFapbiHWg

https://x.com/Red1OneX/status/2094862171348021528


文章来自于"APPSO",作者 "APPSO"。