天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

谷歌为Gemini模型增智能体视频理解功能,降成本提效率助力视频处理新突破

2026-09-03来源:快讯编辑:瑞雪

谷歌近日宣布,为Gemini系列中的3.7 Flash、3.6 Flash及3.5 Flash-Lite模型引入了一项突破性的智能体视频理解功能。这一创新不仅显著提升了模型对视频内容的分析精度,还大幅降低了资源消耗与成本,为视频处理领域带来了新的可能性。

传统的视频处理方式多采用静态模式,即按照固定的帧率读取视频内容,默认帧率为每秒1帧(1FPS)。尽管开发者可以通过应用程序接口调整这一参数,但这种方式在处理长视频或需要高精度分析的场景时,往往面临高额Token开销与关键细节遗失的两难选择。谷歌此次推出的智能体视频理解功能,通过将模型的核心推理能力与原生视频工具相结合,实现了对视频视觉帧、音频及转录文本的动态检索、扫描与核验,从而有效解决了这一问题。

据基准测试结果显示,搭载这一新功能的Gemini模型在视频分析成本上最高可降低66%,Token消耗量最高减少88%,同时分析准确率最高提升7%。这一技术优势在长视频处理中尤为显著,使得开发者在保持分析质量的同时,能够显著降低运营成本。谷歌特别指出,Gemini 3.7 Flash与新功能的结合,在综合表现上达到了分析质量与成本效率的最佳平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度,以及选取视频帧、音频、转录文本等信息模态。这一变革意味着,以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成,从而大幅缩减了开发工作量。例如,在处理快速运动画面或细微视觉异常时,模型可以针对指定时间窗口调高采样帧率,确保不遗漏任何关键信息。

该功能还具备多项实用特性,如支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,为高精度自动化视频编辑提供了有力支持。同时,它还能对时长数小时的长视频开展复杂内容检索,而无需消耗海量Token资源。智能体视频理解功能还能对时序下的重复动作、多类物体实现精准计数,进一步拓展了其应用场景。

目前,这项功能已在Google AI Studio及Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松开启这一能力。谷歌还透露,未来这项技术能力将逐步向面向普通用户的产品落地,包括推送至Gemini应用全部Flash、Flash-Lite模型用户,以及赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型输出更贴合视频画面内容的问答结果。

OpenAI将探索人形机器人研发,奥尔特曼:工业应用先行,未来或入家庭
OpenAI 首席执行官萨姆 · 奥尔特曼(IT之家注:Sam Altman)昨日出席《Sources Podcast》视频播客时表示:“我们肯定会研发人形机器人,我们也会做其他形态的人形机器人。”他更希望…

2026-09-03

约翰迪尔发布AI助手JD:赋能农民精准决策,数据承诺保障隐私安全
在此背景下,此次早期体验计划(Early AccessProgram)的测试公告同时附上了公司的"十项农民数据承诺",明确表示不会出售用户数据,并赋予农民自主控制第三方数据共享的权利:10. 约翰迪尔将持…

2026-09-03

嘉定区创新启用无人机巡河 科技赋能构建智慧河湖管护新体系
无人机可在120米高空稳定作业,突破地面树木遮挡、弯道岸线、偏僻小微水体等巡查屏障,对河道水面、岸坡、排口、堤防等开展立体化全景巡查,补齐人工巡河视野短板,实现辖区河湖应巡尽巡,消除监管盲区,兼具日常管护排…

2026-09-03

北京理工科研团队创新突破 片上光谱计算让高光谱信息现场实时处理成现实
这一次,团队进一步攻克后端实时计算难题,通过挖掘光谱数据关联性减少重复计算,并针对光谱数据特点重新设计芯片架构运算单元,让原本需要在服务器中来回“奔波”的数据,在专用芯片中连续完成计算。 边丽蘅介绍,高光谱成…

2026-09-03