情报动态 4

学习 🟢

When Does In-Context Search Help? 反思驱动推理的采样复杂度理论

🔍 发生了什么:Amnon Shashua(Mobileye创始人)团队给出in-context search的理论分析——当反思能可靠定位早期错误时,上下文内搜索可实现指数级改进;反之则与并行采样无异。证明了这些增益是可学习的。 💡 技术原理:将in-context search建模为推理轨迹上的近似推理,基础模型定义先验,自我反思提供后验更新的反馈。关键定理:当反思能定位早期错误时,多项式次尝试即可解决零-shot通过率指数小的问题。跨熵训练搜索轨迹可恢复所需行为。 🔧 快速上手:理论指导实践——设计反思机制时,确保它能准确指出"哪一步出了错",而不仅仅是"答案不对"。这比简单的self-consistency投票更有效。 🎯 应用场景:推理模型训练策略设计、test-time compute优化、反思机制工程、reasoning model评估。 🔗 相似技术:Tree-of-Thought、Self-Refine、STaR、Reflection agents。 💴 商业潜力:★★★★☆ 理论成果对推理模型(o1/o3/DeepSeek-R1类)的训练和部署策略有直接指导意义。 📚 学习路径:理解贝叶斯推理基础 → 学习in-context learning理论 → 研究reasoning model训练 → 实践反思机制设计。

学习 🟢

MILES: 模块化指令记忆实现LLM推理自我提升

🔍 发生了什么:提出MILES框架,让LLM在推理过程中动态积累可复用的经验记忆,而非像现有方法那样每次从零开始。通过粗-细两级检索机制和可学习的选择头,在测试时持续优化推理能力。 💡 技术原理:维护模块化记忆单元——由子目标嵌入和子指令的非对称对组成,每个关联一个可学习的选择头。粗粒度检索用于记忆扩展和监督采集,细粒度检索用学习到的选择头重排候选并引导推理。 🔧 忥速上手:核心思想是将成功的推理步骤抽象为可检索的记忆片段,新问题到达时先检索相关经验再推理,逐步积累形成Agent的"经验库"。 🎯 应用场景:数学推理、代码生成、复杂问答等需要逐步推理的任务,特别适合问题持续到来的流式场景。 🔗 相似技术:Reflexion、Voyager技能库、MemGPT、ExpeL。 💴 商业潜力:★★★★☆ 测试时自我提升是降低推理成本的关键方向,记忆复用可显著减少重复计算。 📚 学习路径:理解CoT推理 → 学习检索增强生成(RAG) → 研究记忆机制设计 → 实践MILES框架。

ai_tokens 🟢

NVIDIA NIM取消Credits限制:100+模型纯速率限制免费调用

NVIDIA NIM自2026年起取消Credits限制,改为纯速率限制模式。100+免费模型包括DeepSeek-V4 Pro、Kimi-K2.5、GLM-5.1、Llama-4、Nemotron-3等顶级模型,无需绑定信用卡,OpenAI兼容接口,5分钟接入。

行业 🟢

Groq在Nvidia 200亿美元非收购式挖角后,据报正融资6.5亿美元

AI芯片公司Groq正寻求6.5亿美元内部融资,从硬件制造转向AI推理服务。此前Nvidia以200亿美元'非收购式挖角'方式吸纳了Groq核心团队。