#understanding
共 6 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 6
TimeProVe:先提议再验证,长视频理解成本降低93%同时精度提升7.3%
TimeProVe提出两阶段框架解决长视频问答的效率-精度矛盾:先用轻量级ACE模块从视频中提取动作级候选证据并生成假设,再调用大型VLM精准验证。在ADL场景基准OTB上超越最强基线7.3%,VLM调用减少75%,推理成本降低93%。
TimeProVe: 提议再验证——高效长视频理解的新范式
TimeProVe提出了一种先提议再验证的高效长视频理解框架,通过ACE模块先用轻量级模型定位候选证据,再调用大型视觉语言模型精准验证。该方法将VLM调用减少75%、推理成本降低93%,同时准确率提升7.3%。论文还推出了OpenTSUBench基准测试,专门评估日常生活活动场景中的时序推理能力。
TimeProVe:先提议后验证,高效理解长视频的时间推理框架
TimeProVe 提出了一种'先提议、后验证'的两阶段框架,用于高效处理长视频问答。通过轻量级 ACE 模块提取动作级别的候选证据,再用大型 VLM 做针对性验证,在 OTB 基准上比最强基线高出 7.3%,VLM 调用减少 75%,推理成本降低 93%。该方法无需专门的时间定位训练就能实现零样本时间定位,代表了'聪明使用计算'的新趋势。
TimeProVe:先提议后验证,高效理解长视频的时间推理框架
TimeProVe 提出了一种'先提议、后验证'的两阶段框架,用于高效处理长视频问答。通过轻量级 ACE 模块提取动作级别的候选证据,再用大型 VLM 做针对性验证,在 OTB 基准上比最强基线高出 7.3%,VLM 调用减少 75%,推理成本降低 93%。该方法无需专门的时间定位训练就能实现零样本时间定位,代表了'聪明使用计算'的新趋势。
TimeProVe:先提案后验证——高效长视频时序推理的新范式
TimeProVe提出先提案后验证的两阶段框架,用轻量模型筛选候选证据再用VLM精准验证,在长视频问答任务上实现93%成本降低和7.3%性能提升,同时引入OTB日常生活时序推理基准。
TimeProVe:先提议再验证,高效长视频理解的新范式
TimeProVe提出一种先提议再验证的混合框架用于长视频时序推理。通过轻量级动作检测和LLM候选生成,仅对少量候选调用昂贵VLM验证,在OTB基准上提升7.3%准确率的同时减少75%的VLM调用和93%的推理成本,并提出了面向日常活动的OTB基准。