天脉资讯
财经快讯 价值公司 财经人物 IPO解读 热门赛道 经济解码 科技业界 文化艺术 消费零售 大燕公益 商业快讯

谷歌为Gemini模型添智能体视频理解功能,降成本提精度助力视频处理

2026-09-03来源:快讯编辑:瑞雪

谷歌近日宣布,为Gemini 3.7 Flash、3.6 Flash以及3.5 Flash-Lite模型引入了一项创新的智能体视频理解功能。这一功能不仅显著提升了模型在视频分析任务中的准确率,还大幅降低了资源消耗与使用成本。值得注意的是,该功能遵循Gemini API的标准Token计费规则,不会额外增加使用费用。

传统上,模型处理视频主要依赖静态处理模式,即按照固定帧率读取视频内容,默认帧率为1帧每秒。尽管开发者可以通过应用程序接口调整这一参数,但这种方式在处理长视频时往往面临高额Token开销与遗漏关键细节的权衡难题。谷歌此次推出的智能体视频理解功能,通过将模型核心推理能力与原生视频工具相结合,实现了从视频视觉帧、音频及转录文本中动态检索、扫描和核验目标片段的能力。

基准测试数据显示,搭载智能体视频理解功能的Gemini模型在视频分析成本上最高可降低66%,Token消耗量最高减少88%,同时分析准确率最高提升7%。这一技术优势在长视频处理场景中尤为显著,有效解决了开发者在处理长视频时面临的成本与细节保留的矛盾。谷歌指出,Gemini 3.7 Flash与新功能的结合,在分析质量与成本效率之间实现了最佳平衡,处于视频理解任务准确率与成本的帕累托最优前沿。

智能体视频理解功能赋予了模型自主决策能力,使其能够根据任务目标自主选择读取内容、播放速度,并灵活选取视频帧、音频及转录文本等信息模态。这一转变意味着,以往需要开发者手动完成的筛选操作,如今可由模型通过智能循环调用内部工具自动完成,从而大幅缩减了开发工作量。

该功能还具备多项实用特性,如支持亚秒级时刻检索,能够精准捕捉固定帧率下容易遗漏的状态变化与剪辑边界,为高精度自动化视频编辑提供了有力支持。它还能对长达数小时的长视频进行复杂内容检索,而无需消耗海量Token资源。针对快速运动画面或细微视觉异常,该功能可通过调高指定时间窗口的采样帧率进行检测,同时实现对时序下重复动作及多类物体的精准计数。

目前,这项功能已在Google AI Studio及Gemini企业智能体平台的Gemini应用程序接口上线,支持本地视频上传与YouTube视频解析。开发者只需在接口配置中将处理模式设置为“agentic”,即可轻松启用该能力。

根据谷歌的规划,这项技术能力还将逐步向面向普通用户的产品推广。未来,该功能将推送至Gemini应用全部Flash、Flash-Lite模型用户。在接下来的数月内,智能体视频理解还将赋能YouTube视频页面的“Ask YouTube”功能,依托Gemini模型提供更贴合视频画面内容的问答结果。

马斯克G20财长会议发声:2036年全球人形机器人或超10亿台,AI将促经济大幅增长
【太平洋科技】据央视财经报道,当地时间 9 月 1 日,埃隆·马斯克在 G20 财长会议上表示,人形机器人行业将带来一场惊人变革。马斯克提出,至 2036 年,全球人形机器人数量有望突破 10 亿台。结…

2026-09-03

优必选携手麦迪科技推出全国首款优麦机器人康养版,拓展医疗康养新布局
IT之家 9 月 3 日消息,优必选今日宣布携手麦迪科技发布全国首款仿生医疗机器人——优麦机器人康养版,打造搭载专业医疗服务能力的仿生人形机器人,进一步拓展优必选在医疗康养赛道的落地布局。 据官方 PPT …

2026-09-03

Meta发布Muse Spark 1.3:性能跃升,AI赛道竞争加剧且商业化提速
Meta周三发布其迄今最强大的人工智能模型Muse Spark 1.3,首席AI官AlexandrWang称其性能已追平甚至超越主要竞争对手,标志着这家社交媒体巨头在AI军备竞赛中迈出重要一步。 Wang透…

2026-09-03