技术文章 8

当前世界模型缺少持久状态核心:23个模型测试揭示AI的致命盲区

这篇论文揭示了当前世界模型的根本缺陷:当摄像头移开时,AI世界就暂停了。研究者提出WRBench基准,在23个模型9600个视频上系统证明,更高的保真度、更强的控制、更大的参数量都无法解决这一问题,需要架构层面的根本变革。

TimeProVe:先提议再验证,长视频理解成本降低93%同时精度提升7.3%

TimeProVe提出两阶段框架解决长视频问答的效率-精度矛盾:先用轻量级ACE模块从视频中提取动作级候选证据并生成假设,再调用大型VLM精准验证。在ADL场景基准OTB上超越最强基线7.3%,VLM调用减少75%,推理成本降低93%。

TimeProVe: 提议再验证——高效长视频理解的新范式

TimeProVe提出了一种先提议再验证的高效长视频理解框架,通过ACE模块先用轻量级模型定位候选证据,再调用大型视觉语言模型精准验证。该方法将VLM调用减少75%、推理成本降低93%,同时准确率提升7.3%。论文还推出了OpenTSUBench基准测试,专门评估日常生活活动场景中的时序推理能力。

TimeProVe:先提议后验证,高效理解长视频的时间推理框架

TimeProVe 提出了一种'先提议、后验证'的两阶段框架,用于高效处理长视频问答。通过轻量级 ACE 模块提取动作级别的候选证据,再用大型 VLM 做针对性验证,在 OTB 基准上比最强基线高出 7.3%,VLM 调用减少 75%,推理成本降低 93%。该方法无需专门的时间定位训练就能实现零样本时间定位,代表了'聪明使用计算'的新趋势。

TimeProVe:先提议后验证,高效理解长视频的时间推理框架

TimeProVe 提出了一种'先提议、后验证'的两阶段框架,用于高效处理长视频问答。通过轻量级 ACE 模块提取动作级别的候选证据,再用大型 VLM 做针对性验证,在 OTB 基准上比最强基线高出 7.3%,VLM 调用减少 75%,推理成本降低 93%。该方法无需专门的时间定位训练就能实现零样本时间定位,代表了'聪明使用计算'的新趋势。

TimeProVe:先提案后验证——高效长视频时序推理的新范式

TimeProVe提出先提案后验证的两阶段框架,用轻量模型筛选候选证据再用VLM精准验证,在长视频问答任务上实现93%成本降低和7.3%性能提升,同时引入OTB日常生活时序推理基准。

TimeProVe:先提议再验证,高效长视频理解的新范式

TimeProVe提出一种先提议再验证的混合框架用于长视频时序推理。通过轻量级动作检测和LLM候选生成,仅对少量候选调用昂贵VLM验证,在OTB基准上提升7.3%准确率的同时减少75%的VLM调用和93%的推理成本,并提出了面向日常活动的OTB基准。

JanusMesh:3-5分钟生成「双面神」3D幻象,零训练跨空间去噪框架

JanusMesh提出无需训练的3D视觉幻象生成框架,通过跨空间双分支去噪将几何融合与纹理合成解耦,仅需3-5分钟即可生成从不同角度看呈现完全不同语义的3D模型,在速度、几何完整性和语义清晰度上全面超越现有方法。该工作被ECCV 2026接收。