情报流
安全漏洞 · AI动态 · 加密 · 工具 · 行业情报
Agent 记忆与上下文层设计:从 OpenViking 学最佳实践
拆解 OpenViking 的统一上下文层设计:把 Agent 记忆、知识 RAG 与技能合并为一层自进化数据库,比"文件+向量库+散落配置"的方案更利于跨框架复用。
Top AI Product为什么 Agent 计费方式决定你的架构选型
Agent 应用按循环消耗 token:读文件、工具结果、改方案、生成代码,单次请求即多个回合。Sonnet 5 价格冻结让以完成任务成本评估模型变得可行,选型应从提示词单价转向端到端成本。
RuntimeWire递归语言模型(RecLM):Agent 上下文即代码的新范式
基于 arXiv:2512.24601 的递归语言模型思想:让 Agent 用持久 Python 会话管理自身上下文,文件、命令与子 Agent 全部以代码表达,Prime Agent 已将其产品化。
DEV CommunityAI Agent 成本控制实战:会话级预算与支出上限全解析
详解 2026 年 8 月的 Agent 成本控制方案:Anthropic 会话级美元硬预算、AWS Bedrock AgentCore 网关限流、Google 月度支出上限与 OpenAI 429 硬限制,以及 LiteLLM 的会话迭代预算做法,含边界与超支分析。
Nerd Level Techcareer-ops:本地运行的 AI 求职 Agent 工具
career-ops 开源 AI 求职工具:扫描职位门户、按 A-F 结构化评分、定制简历、跟踪申请,完全本地运行于 Claude Code、Codex、OpenCode 等 Agent CLI。
GitHubOpenMed:开源医疗 AI 项目 5000+ stars 上榜 Trending
开源医疗 AI 项目 OpenMed 宣布 GitHub stars 突破 5000 并登上 Trending 榜单,反映垂直领域 Agent 应用的开源热度持续上升。
ABAB Newsbrowser-use 发布 macOS harness:浏览器 Agent 直接操作 Mac
browser-use 推出实验性 macos-harness,让浏览器 Agent 直接控制 macOS 桌面,MIT 许可,99.8% Python,发布首日三连发三个版本,定位"实验性、仅 macOS"。
MoClawOpenViking:开源统一 Agent 记忆/知识/技能层(29K stars)
字节跳动火山引擎开源 OpenViking:把 Agent 记忆、知识 RAG 与技能合并为自进化上下文层,Apache 许可,提供 Python 库与火山引擎托管 API,可接入任意 Agent 框架。
Top AI ProductPrime Agent:把 Agent 装进 Python 解释器的新范式
Prime Intellect 的 Prime Agent 让模型持有持久 Python 会话,把上下文管理变成代码本身,单日 2319 stars 登顶 Trending。基于 2025 年 10 月的递归语言模型(arXiv:2512.24601)思想。
DEV CommunityDeepSeek Harness:插件化 AI Agent 运行时正式开源
DeepSeek 开源 Agent 运行时 DeepSeek Harness:基于 Node.js、MIT 许可,提供四种执行模式,"一切皆插件",支持 Anthropic、OpenAI、AWS Bedrock、Azure 与 Gemini 平台,并可把子任务直派给 Claude Code 与 Codex。
Digital Today微软 Copilot 换用自研模型:降本还是生态重构?
在 OpenAI/Anthropic 涨价背景下,微软 Copilot 已用更便宜的自研模型替换部分高价第三方模型,反映出大型平台厂商正加速模型自主化以控制 Agent 规模成本。
The Decoder美国拟强化前沿 AI 出口管制,企业面临模型选型合规风险
随着中国开源模型在企业端走强,美国官员警告可能对前沿 AI 技术实施更强出口管制;中国也考虑收紧自身技术出口以作反制。企业模型选型需同时权衡性能、成本与监管风险。
TechRepublic企业 AI 计费走向"消费化":Forrester 解读 Anthropic 定价模型
Forrester 分析指出,AI 厂商正从固定席位费转向"访问+按 token 消费"双轨计费,Anthropic 的平台访问与 Agent SDK 积分分离模式成为行业方向,企业预算压力转向用量治理。
ForresterAI 定价战升级:OpenAI、Anthropic 齐降前沿模型价格
OpenAI 与 Anthropic 两周内相继下调前沿模型价格,OpenAI 7 月 30 日对 GPT-5.6 家族降价,Anthropic 8 月 10 日宣布 Sonnet 5 价格冻结。开源权重模型与成本审计压力是主因。
The StackAnthropic 提交 IPO S-1 草案,估值瞄准 9650 亿美元
Anthropic 已向监管机构提交 IPO S-1 草案,此前 5 月完成 650 亿美元融资,投后估值 9650 亿美元。若顺利上市将成为史上最大 IPO,估值与 OpenAI(目标超 1 万亿美元)同处万亿美元量级。
Reuters开源权重模型挤压闭源定价:DoorDash、Airbnb、Coinbase 转用中国模型
硅谷数据显示 7 月中旬以来企业推理 token 支出正从闭源流向开源权重模型,DoorDash、Airbnb、Coinbase 等确认使用中国开源模型处理部分生产负载。OpenRouter 等路由服务加速了这一迁移。
TechRepublicOpenAI 硬性支出上限全量上线:超限返回 429
7 月 23 日起 OpenAI API 平台为所有账户提供组织/项目级硬性月度支出上限,超限请求返回 429(spend limit exceeded)。注意执行并非瞬时,可能存在轻微超额。
OpenAIAnthropic 上线会话级硬预算:单个 Agent 会话设美元上限
8 月 7 日 Anthropic 为 Claude Managed Agents 会话新增硬性美元预算(按美分整数),到达上限后暂停模型请求。AWS Bedrock AgentCore 前一日也上线网关级消费上限,Agent 成本控制进入会话粒度时代。
Nerd Level TechOpenAI 悄悄测试 $8 "付费重置配额" 功能
部分 ChatGPT Plus($20/月)用户在配额耗尽后看到黑色"支付 $8 重置"按钮。此前 6 月曾推出 Codex 重置机制,此举显示 OpenAI 正探索按用量二次变现。
Business InsiderOpenAI 推出 ChatGPT Business Premium Seats:$125/月/人
OpenAI 为 ChatGPT Business 新增 Premium Seats,$125/月(年付 $100),提供 5 倍用量且不受 5 小时限制,普通席位维持 $25。Agent 型工作负载消耗 token 剧增是涨价的直接原因。
The DecoderAnthropic 冻结 Sonnet 5 价格:$2/$10 永久化,取消 9 月涨价
Anthropic 于 8 月 10 日宣布 Claude Sonnet 5 的 $2/$10 每百万 token 首发价永久生效,取消原定 9 月 1 日涨至 $3/$15 的计划。对 Agent 应用而言,1 亿输入+2000 万输出 token 的月成本从 $6000 降至 $4000。
RuntimeWireOpenAI 大幅下调 GPT-5.6 Luna/Terra 价格:Luna 降价 80%
7 月 30 日 OpenAI 将最低端 GPT-5.6 Luna 价格下调 80%(0.20/1.2 美元每百万 token),中端 Terra 降价 20%(2/12 美元)。官方称源于底层效率提升,反映开源权重模型竞争压力。
The Stackmodular/modular:Mojo 语言仓库持续高热(27.5K stars)
Mojo 语言 GitHub 仓库继续保持热度,27.5K stars,单日新增约 340,面向高性能 AI 计算编程语言生态持续壮大。
GitHubbrowser-use/macos-harness:让浏览器 Agent 直接操作 macOS(发布即上榜)
browser-use 联合创始人发布 macos-harness,让 AI 浏览器 Agent 直接接管 macOS 桌面操作,MIT 许可,发布首日即上 Trending,定位实验性 macOS 自动化。
GitHubmattpocock/skills:超 22 万 stars 的 Agent 技能合集
mattpocock/skills 集合了大量可供 AI 编程 Agent 直接调用的技能文件,star 数已超 22.4 万,成为 Agent 技能生态的标杆仓库。
GitHubai-memory:Rust 编写的 Agent 记忆库(单日 +335 stars)
akitaonrails/ai-memory 用 Rust 实现轻量 Agent 记忆存储,3.4K stars 且单日新增 335,主打高性能本地记忆管理。
GitHubcareer-ops:开源 AI 求职助手(66K stars)
santifer/career-ops 以 AI 驱动求职全流程:扫描职位门户、按 A-F 结构评分、定制简历并跟踪申请,本地运行于 Claude Code、Codex、OpenCode 等 Agent CLI。
GitHubreverse-skill:面向攻防的智能体技能路由器(20K stars)
reverse-skill 登上 GitHub Trending 榜首,是一个面向逆向工程、授权渗透测试与 CTF 的技能路由器,为 AI 编程 Agent 编排范围设定、剧本、工具链与报告,支持 Claude Code、Codex CLI、Cursor 等。
GitHubPrime Agent:把 Agent 放进 Python Shell 的开源项目(11.4K stars)
Prime Intellect 开源 Prime Agent,单日冲上 GitHub Trending 第一(2319 stars)。核心思路是让模型持有持久 Python 解释器会话,把文件、命令与上下文管理全部当作代码来写,基于递归语言模型理念。
GitHubOpenViking:字节跳动开源 AI 智能体统一上下文层(29K stars)
字节跳动火山引擎开源 OpenViking,将 Agent 记忆、知识 RAG 与技能整合为自进化上下文层,Apache 许可,单日新增 213 stars,社区已出现 OpenClaw 插件。
GitHubDeepSeek Harness 破 GitHub 史上最快涨星纪录(14 万+ stars)
DeepSeek 于 8 月 13 日开源 AI 智能体运行时 DeepSeek Harness,一小时内突破 2 万 stars,刷新 Grok-1 保持的最快纪录,四天超过 13 万 stars。采用"一切皆插件"设计,支持多种执行模式与 Anthropic、OpenAI、AWS、Azure、Gemini 等平台。
GitHubNginx 等主流 Web 组件 7 月发布多项安全更新
Nginx 与多家主流 Web 组件厂商于 7 月下旬发布安全更新,修复多个可导致信息泄露与拒绝服务的问题。线上服务应核对自身版本并安排升级窗口。
NginxCISA KEV 持续扩容:在野利用漏洞清单更新提醒
CISA 持续更新已知被利用漏洞目录 (KEV),8 月新增多款在野利用的 Windows、浏览器与开源组件漏洞。建议安全团队周期性同步 KEV 清单,对照自身资产优先处置。
CISA龙芯 LoongArch 处理器被曝侧信道攻击风险
安全研究人员公开针对龙芯 LoongArch 架构处理器的侧信道攻击研究,可结合漏洞利用获取敏感数据。国产芯片生态的安全审计与微码更新需同步推进。
SecurityWeekCoca-Cola Fairlife 遭 Anubis 勒索软件攻击,约 1TB 数据泄露
Coca-Cola 旗下 Fairlife 业务遭 Anubis 勒索软件攻击,攻击者窃取约 1TB 数据。事件再次凸显供应链与巨头企业的勒索风险,相关行业的备份与响应预案需要复盘。
BleepingComputerIntel 471:供应链攻击正转向 AI 编程助手与智能体生态
Intel 471 报告指出,攻击者正将投毒目标从传统 npm/PyPI 转向 AI 编程助手生态,包括恶意 skill、插件与"流行包代理"手法,针对 Cursor、Claude Desktop 等 Agent 环境。企业应对 Agent 引入的第三方组件执行来源审计。
Intel 4718月星期二补丁:微软修复 415 个漏洞,含 62 个严重级与 AFD 零日
微软 8 月补丁日共修复 415 个漏洞,其中 62 个为严重级;CVE-2026-68820(AFD for Winsock 提权)已确认遭在野利用,另有多个 CVSS 9.8 的 QUIC、DNS、iSCSI、WDS 远程代码执行漏洞。建议优先修复被利用漏洞与关键网络服务。
The Hacker NewsJadePuffer:首个由 AI 智能体驱动的勒索软件攻击链
Sysdig 披露 JadePuffer 攻击活动:攻击者利用 Claude 等 AI 智能体自动化侦查、横向移动与勒索部署,被认为是首个以 AI 智能体为核心编排的勒索软件攻击链。防御重点转向对 Agent 行为的检测与沙箱隔离。
Sysdig360:2026年7月勒索软件流行态势分析,五大新家族登场
360 发布 2026 年 7 月勒索软件流行态势分析:新增 ExfilSquad、CRPxO、GSG、Section9、Gammax 等勒索家族,BrzCrypt 与 Wmansvcs 判定为同一团伙所为。企业应重点强化备份、补丁与口令治理。
360"Sorry" 勒索软件大规模攻击暴露的 Linux Web 服务器(利用 cPanel CVE-2026-41940)
CVERC 发布预警:名为 "Sorry" 的勒索软件利用 cPanel 授权绕过漏洞 (CVE-2026-41940 / CNNVD-202604-5641) 攻击暴露在公网的 Linux Web 服务器,加密文件并索要赎金。Go 语言编写,运行于 Linux 环境。管理员应尽快修补 cPanel 并收敛公网暴露面。
CVERCWindows 用户配置文件服务 LegacyHive 提权漏洞 (PoC 已公开)
Windows 用户配置文件服务 (User Profile Service) 存在被命名为 LegacyHive 的本地提权漏洞,概念验证代码已公开。建议尽快应用补丁并监控异常账户行为。
NVDApache Struts JSON 资源耗尽拒绝服务漏洞 (CVE-2026-73633)
Apache Struts 在处理 JSON 请求时存在资源耗尽漏洞,攻击者可通过构造恶意 JSON 请求导致拒绝服务。Struts 用户应升级到官方修复版本。
NVDMicrosoft Edge 堆缓冲区溢出漏洞 (CVE-2026-72970)
Microsoft Edge 存在堆缓冲区溢出漏洞,CVSS 评分 8.4,攻击者可利用特制网页导致内存破坏并可能执行任意代码。请更新 Edge 至最新版本。
NVDPowerShell 命令注入漏洞 (CVE-2026-50523)
PowerShell 存在命令注入漏洞,攻击者可通过特制输入注入并执行任意命令。建议将 PowerShell 升级到最新版本并审查自动化脚本的输入来源。
NVDApache Tapestry classpath 下载漏洞 (CVE-2026-61899)
Apache Tapestry 存在可下载 classpath 相关文件的漏洞,攻击者可能借此获取敏感配置与字节码。Java Web 应用请升级 Apache Tapestry 到安全版本。
NVDAWS SDK for C++ Base64 越界读取漏洞 (CVE-2026-19642/CVE-2026-643)
AWS SDK for C++ 的 Base64 解码实现存在越界读取漏洞,可能导致内存信息泄露或拒绝服务。使用 AWS C++ SDK 的应用应升级到修复版本。
NVDKVM 虚拟机逃逸漏洞 Januscape
Linux KVM 虚拟化组件存在被命名为 Januscape 的虚拟机逃逸漏洞,攻击者可从虚拟机内逃逸影响宿主机。云厂商与虚拟化环境需尽快评估并打补丁。
NVDLinux 内核 GhostLock 本地提权漏洞
Linux 内核存在被命名为 GhostLock 的本地提权漏洞,攻击者可在受影响系统上获取更高权限。请及时升级内核并关注发行版安全公告。
NVDLinux 内核 RefluXFS 本地提权漏洞
Linux 内核 RefluXFS 文件系统存在本地提权漏洞,攻击者可通过特制文件系统操作在系统上提升权限。建议服务器尽快升级内核版本。
NVDvm2 沙箱逃逸远程代码执行漏洞 (GHSA-cfcw-xp6x-25gj)
Node.js 沙箱库 vm2 存在沙箱逃逸漏洞,CVSS 评分 9.8,攻击者可在沙箱内执行任意代码逃逸到宿主机。项目已停止维护,强烈建议迁移到其他沙箱方案。
GitHub AdvisoryWindows 内核权限提升漏洞 (CVE-2026-62788)
Windows 内核存在权限提升漏洞,CVSS 评分 9.8,本地攻击者可利用该漏洞获取系统最高权限。建议尽快应用 8 月安全更新。
NVDMicrosoft Teams 远程代码执行漏洞 (CVE-2026-65667)
Microsoft Teams 存在远程代码执行漏洞,CVSS 评分 10.0,属于企业协作场景的高危风险。建议尽快更新 Teams 客户端并留意官方通告。
NVDAzure Confidential Ledger 远程代码执行漏洞 (CVE-2026-68823)
Azure Confidential Ledger 存在远程代码执行漏洞,CVSS 评分 9.1。机密账本服务用于高安全场景,一旦被攻破影响严重,应关注微软官方更新。
NVDAzure Service Bus 远程代码执行漏洞 (CVE-2026-50515)
Azure Service Bus 存在远程代码执行漏洞,CVSS 评分 9.9。使用 Service Bus 的云架构应关注微软的租户隔离加固措施,并评估自身消息服务暴露面。
NVDSharePoint Server 远程代码执行漏洞 (CVE-2026-63520)
SharePoint Server 存在远程代码执行漏洞,CVSS 评分 8.1,由 Rapid7 发现并可与 CVE-2026-55040 链式利用。建议尽快更新至最新累积更新并关注官方缓解措施。
NVDExchange Server 权限提升漏洞 (CVE-2026-62911)
微软 Exchange Server 存在权限提升漏洞,CVSS 评分 8.0,由 Pwn2Own Berlin 大赛披露。攻击者可提升权限进一步横向移动,建议尽快应用补丁。
NVDWindows iSCSI 目标远程代码执行漏洞 (CVE-2026-65791)
Windows iSCSI 目标组件存在远程代码执行漏洞,CVSS 评分 9.8,攻击者可远程利用实现任意代码执行。存储场景下影响面广,建议优先升级。
NVDWindows DNS Server 远程代码执行漏洞 (CVE-2026-62878)
Windows DNS Server 存在远程代码执行漏洞,CVSS 评分 9.8。域控制器上的 DNS 服务一旦被利用可直接接管内网,属于 8 月补丁日优先级最高的修复项之一。
NVDWindows 部署服务 TFTP 远程代码执行漏洞 (CVE-2026-62893)
Windows 部署服务 (WDS) 的 TFTP 协议实现存在远程代码执行漏洞,CVSS 评分 9.8。WDS 用于批量部署操作系统,在域内网络中风险面较大,应尽快更新。
NVDMicrosoft QUIC 远程代码执行漏洞 (CVE-2026-62815)
微软 QUIC 协议栈存在远程代码执行漏洞,CVSS 评分 9.8,攻击者可远程利用该漏洞在目标系统上执行任意代码。建议尽快应用 8 月安全更新。
NVDWindows AFD.sys 提权漏洞已被在野利用 (CVE-2026-68820)
Windows 内核 Winsock AFD 驱动存在权限提升漏洞,微软确认已遭在野利用,攻击者获得低权限后可通过该漏洞提升至 SYSTEM。属于 8 月补丁日唯一被利用的零日,务必优先修复。
NVD/CISA KEVMindsDB Minds Platform 未授权远程代码执行漏洞 (CVE-2026-73678)
MindsDB 的 Minds Platform 存在未授权远程代码执行漏洞,攻击者可无需认证直接在服务器上执行任意命令,CVSS 评分高达 10.0。属于 AI 数据基础设施的严重风险,应尽快修复。
NVDFirefox/Thunderbird JavaScript GC 缓解绕过漏洞 (CVE-2026-74938)
Firefox 与 Thunderbird 的 JavaScript 垃圾回收缓解机制存在绕过漏洞,攻击者可通过特制网页触发内存破坏进而远程代码执行,CVSS 评分 9.8。建议尽快升级至最新版本。
NVDOracle Helidon 认证绕过漏洞 (CVE-2026-73939)
Oracle Helidon 存在认证绕过漏洞,攻击者可无需认证利用 HTTP 请求绕过身份验证访问受保护资源,CVSS 评分 8.6。建议受影响版本尽快升级并检查访问日志中的异常请求。
NVDCursor编辑器沙箱逃逸与任意文件写入漏洞 (CVE-2026-50548/50549)
AI代码编辑器Cursor在3.0之前版本存在两个严重沙箱逃逸漏洞,Agent终端命令可突破沙箱限制写入任意文件或通过路径规范化绕过检查。CVSS 9.8,影响广泛使用的AI编程工具。
NVDNode.js TLS主机名嵌入空字符绕过验证漏洞 (CVE-2026-48930)
Node.js在TLS主机名处理中存在嵌入式空字符(NUL)导致C字符串截断的漏洞,攻击者可利用此缺陷实现静默的权威重绑定,绕过TLS证书验证。影响所有受支持的Node.js版本。
NVDFeast特征平台gRPC反序列化RCE漏洞 (CVE-2026-56121)
开源特征存储平台Feast在0.63.0之前版本中存在不安全的反序列化漏洞,未经认证的攻击者通过发送恶意gRPC请求可实现远程代码执行。影响Red Hat OpenShift AI等AI基础设施。
NVDJoomla iCagenda附件上传任意代码执行漏洞 (CVE-2026-48939)
Joomla iCagenda扩展的文件附件功能存在任意文件上传漏洞,攻击者可上传PHP文件并执行任意代码,CVSS 9.8。已被CISA加入KEV目录,截止修复日期2026-07-13。
NVD/CISA KEVJoomla SP Page Builder未限制文件上传致RCE漏洞 (CVE-2026-48908)
Joomla的SP Page Builder扩展存在任意文件上传漏洞,未经认证的攻击者可上传并执行PHP代码,CVSS 9.8。已被CISA列入已知被利用漏洞目录(KEV),截止修复日期2026-07-10。
NVD/CISA KEVn8n MCP端点未认证远程代码执行漏洞 (CVE-2026-54309)
n8n工作流自动化平台的MCP浏览器模块在HTTP传输模式下,端点接受未经认证的会话初始化和工具调用,导致远程代码执行。影响2.25.7/2.26.2之前版本,CVSS满分10.0。
NVDTraefik StripPrefix中间件未经认证任意文件读取漏洞 (CVE-2026-48020)
Traefik反向代理的StripPrefix中间件存在严重漏洞,未经认证的攻击者可绕过路径限制读取任意文件,影响2.11.48/3.6.19/3.7.3之前所有版本。该漏洞CVSS满分10.0,已在Red Hat OpenShift等企业环境中广泛部署。
NVDNovita AI免费提供腾讯Hy3推理 — $0/MTok
腾讯Hy3在Novita AI上以$0/MTok免费提供。295B MoE/21B active,256K上下文,支持函数调用/结构化输出/推理控制。发布期间零成本。
alpha-feedRegolo.ai Builder Program — 欧洲60天无限tokens免费
欧洲AI推理平台Regolo.ai推出Builder Program: 60天无限tokens免费+100+开源模型+EU数据驻留+零数据保留。后续可申请€2000 voucher。OpenAI兼容。
alpha-feedAgnes AI周API调用达4.66万亿tokens + 推出Pavo创意工作室
Agnes AI报告免费API周调用量达4.66万亿tokens。6月29日推出Pavo创意工作室(web端免费AI创作平台)。新加坡AI Lab Top10,永久免费多模态API。
alpha-feedHappyHorse 1.0 — 阿里淘天开源AI视频生成模型#1排名
阿里淘天集团开源HappyHorse 1.0,15B参数AI视频模型,Artificial Analysis T2V/I2V双榜#1。原生1080p+音频同步,50+风格,~10秒生成。Apache 2.0。
alpha-feedFelo AI免费提供Gemini 4.0 Pro — 无需信用卡
Felo AI将免费集成Gemini 4.0 Pro,支持搜索和LLM Playground。200万token上下文,Deep Think博士级推理,原生多模态。无需信用卡。
alpha-feedV-API公益站上线 — Linux.do社区免费AI API网关
Linux.do社区公益项目V-API上线,聚合DeepSeek/GLM等模型,OpenAI兼容。首发100份×$10兑换码+每日签到奖励。非营利,无商业赞助。
alpha-feed腾讯Hy3正式版发布 — 295B MoE开源+多平台免费评测
腾讯Hy3(295B/21B active, Apache 2.0)正式发布。SWE-bench 74.4%,Agent任务解决率90%。定价¥1/¥4 per MTok。OpenRouter免费评测至7/21,Novita AI当前$0/MTok。
alpha-feedPoolside Laguna XS.2 — 免费API+开源33B MoE编程模型
Poolside发布Laguna XS.2,33B MoE(3B active)开源编程模型,Apache 2.0。SWE-bench Pro 44.5%。OpenRouter和Poolside API限时免费。131K上下文。
alpha-feedSMetric: Agent场景下LLM调度的重新思考
首次系统研究Agent工作负载的调度特性,发现KV复用率>80%(vs人类对话54-62%)。提出会话中心调度策略,TPS提升10-34%,调度器保持无状态。对LLM服务集群有直接工程价值。
arxivDominoTree: 路径条件草稿树实现6.6x推理解码加速
在Qwen3-4B上实现最高6.6x加速,平均接受长度10.7token/轮。CUDA原生构建器保证比特级一致,Alpaca上throughput +22%。直接可部署的推理加速方案。
arxivUltraX: 程序化编辑大规模精炼预训练数据
Scaling Law收益递减背景下,从「要更多数据」转向「要更好数据」。用程序化监督实现细粒度实例级编辑,更少token实现更好性能。对所有LLM预训练数据管线有方法论价值。
arxivProjAgent: 过程相似性检索革新仓库级代码生成
不只看代码像不像,还看实现逻辑像不像。将目标函数分解为推理步骤,检索过程行为相似的仓库函数,REPOCOD Pass@1达41.14%,超越现有基线。对AI编程助手产品有直接指导价值。
arxivRemember When It Matters: 主动记忆Agent解决长时程任务衰减
分离记忆Agent与动作Agent,通过选择性记忆注入解决「行为状态衰减」,Terminal-Bench +8.3pp。即插即用设计可接入任何Agent框架,是Agent记忆工程的最佳实践。
arxivWebSwarm: 递归多智能体编排实现深度+广度网页搜索
提出渐进式递归委派框架,每个搜索节点可自行解决或递归委派子节点,在 BrowseComp-Plus 等基准全面超越单智能体基线。核心价值:搜索 Agent 基础设施级创新,可直接集成到企业知识管理和研究助手产品中。
arxivCVE-2026-53488 | containerd CRI标签注入致宿主机命令执行 (CVSS 8.8)
containerd的CRI插件将镜像LABEL指令中的标签未经验证直接传播到容器,攻击者可通过恶意镜像在宿主机上执行任意命令。影响containerd 1.7.33/2.3.2/2.2.5/2.1.9/2.0.10之前版本,容器安全重大风险。
NVDCVE-2026-45659 | Microsoft SharePoint反序列化RCE (CVSS 8.8, CISA KEV)
Microsoft SharePoint Server存在反序列化不可信数据漏洞,授权攻击者可通过网络执行代码。CISA已确认该漏洞在野被利用,影响SharePoint 2016/2019/Subscription Edition,需紧急安装修补程序。
NVD/CISA KEVCVE-2026-22872 | Capsule Kubernetes多租户提权 (CVSS 9.1)
Kubernetes多租户框架Capsule的Controller以cluster-admin权限运行,租户管理员可通过集群级资源绕过命名空间隔离获取集群管理权限。影响0.13.0之前版本,对多租户K8s环境构成严重威胁。
NVDCVE-2026-5241 | HuggingFace Transformers模型加载RCE (CVSS 9.6)
HuggingFace Transformers的LightGlue模型加载路径存在远程代码执行漏洞,trust_remote_code参数被绕过,攻击者可通过恶意模型仓库在模型初始化时执行任意代码。影响transformers 5.2.0,波及Red Hat OpenShift AI。
NVDCVE-2026-49185 | Acer路由器MDM远程命令注入 (CVSS 9.8)
Acer Connect M6E 5G便携路由器的FieldX MDM功能将未验证的有效负载直接传入Runtime.exec(),导致远程命令注入攻击。攻击者可通过ADB消息通道在设备上执行任意命令,影响所有固件版本。
NVDCVE-2026-42074 | OpenClaude沙箱逃逸致RCE (CVSS 9.8)
OpenClaude编码代理CLI的沙箱禁用参数(dangerouslyDisableSandbox)暴露给LLM,恶意模型可设置该参数逃逸沙箱执行任意系统命令。影响0.5.1之前所有版本,AI编码工具安全风险突出。
NVDCVE-2026-48282 | Adobe ColdFusion路径遍历致RCE (CVSS 10.0, CISA KEV)
Adobe ColdFusion存在路径遍历漏洞,可导致任意代码执行,无需用户交互。CISA已将其加入已知被利用漏洞目录,确认在野利用。影响ColdFusion 2025.9及2023.20之前所有版本,需紧急修补。
NVD/CISA KEVCVE-2026-10611 | MISP认证绕过漏洞 (CVSS 10.0)
MISP在LDAP混合认证+OTP强制模式下存在认证绕过漏洞,攻击者可绕过双因素认证直接访问系统。该漏洞CVSS满分10.0,影响所有使用LDAP混合认证的MISP部署,建议立即升级或禁用mixedAuth配置。
NVDDeepLearning.AI - Generative AI for Everyone
吴恩达2024年推出的生成式AI课程,讲解ChatGPT原理和Prompt设计,面向所有人群。
CourseraMicrosoft Learn - Azure AI Fundamentals (AI-900)
微软官方AI基础学习路径,涵盖CV/NLP/ML核心知识,为AI-900认证备考。
Microsoft Learnfast.ai - Practical Deep Learning for Coders
完全免费的深度学习实战课程,Jeremy Howard主讲,从零开始训练模型,强调动手实践。
fast.aiGoogle AI Essentials (Coursera) - 免费旁听
Google官方AI基础课程,涵盖Prompt Engineering与AI应用,零基础入门首选。免费旁听,付费可获Google证书。
Coursera🔍 STRACE:从Agent混乱执行轨迹中精准定位根因,成功率提升1.4倍
## 🔍 发生了什么 长程Agent优化依赖反思机制,但真实执行轨迹冗余异质,直接优化效率低且易过拟合。STRACE框架在批次级别挖掘失败模式过滤冗余轨迹,在轨迹级别通过因果定位去除非因果步骤,精准识别根因模块。在形式验证任务VeruSAGE-Bench上成功率从42.5%提升至58.5%(1.4倍)。 ## 💡 技术原理 - 批次级:失败模式挖掘 → 过滤冗余轨迹 → 保留代表性失败案例 - 轨迹级:构建文本依赖图 → 因果定位 → 去除非因果步骤 - 根因模块识别:找到真正需要优化的Agent组件 - 高信噪比优化上下文 → 精准有效的策略改进 ## 🔧 快速上手 代码已开源。集成到现有Agent优化循环中,在调用LLM优化Agent策略前,用STRACE预处理执行轨迹。支持任意文本化执行trace。 ## 🎯 应用场景 - Agent调试与优化(自动定位失败原因) - 复杂工作流Agent的持续改进 - 形式验证Agent优化 - 生产环境Agent故障诊断 ## 🔗 相似技术 Reflexion、Self-Refine、AgentOptimizer、Trace-based debugging ## 💴 商业潜力 ⭐⭐⭐⭐ Agent调试是当前最大痛点之一。1.4倍成功率提升+自动化根因分析,对Agent平台公司有直接价值。 ## 📚 学习路径 Agent基础 → Reflexion论文 → 因果推断入门 → STRACE代码
🔬 AI自我改进全景:1250篇论文综述揭示递归自我改进的边界
## 🔍 发生了什么 综合调研1250篇arXiv论文(2024-2026),从两个维度(改进对象×闭环程度)建立统一分类框架。关键发现:已证明的自我改进强度严格遵循验证层级(形式验证器→内在自评估),失败模式(自确认循环、模型崩溃、多样性崩溃)源于对验证层级的违反。「研究方向设定」是当前保持人类在环的最大瓶颈。 ## 💡 技术原理 - 四类改进对象:部署行为、训练策略、评估器、研究过程本身 - 验证层级:形式验证器(最强) > 过程奖励模型 > 评判器 > 内在自评估(最弱) - 受限自我改进:收敛、可评估、已工业化 - 开放递归自我改进(RSI):受接地要求、崩溃动力学和计算约束限制 - 核心洞察:自我改进能力上限 = 评估信号质量 ## 🔧 快速上手 这是综述论文,无需代码。重点关注验证层级框架——在设计自我改进系统时,优先使用强验证信号(可执行测试 > LLM评判 > 自我评估)。 ## 🎯 应用场景 - 设计自我改进系统时选择正确的验证机制 - 评估AI系统自主研究能力的上限 - AI安全治理框架设计 - Meta-learning和AutoML系统设计 ## 🔗 相似技术 Self-Refine、Self-Reward、Self-Play、Constitutional AI、STaR ## 💴 商业潜力 ⭐⭐⭐⭐ 对所有构建自我改进AI系统的团队(OpenAI、Anthropic、DeepMind)具有直接指导意义。验证层级框架可直接应用于系统设计。 ## 📚 学习路径 RLHF基础 → Self-Refine综述 → Constitutional AI → 本文
🎯 Diffusion RLHF效率提升6倍:选择性时间步加权+优势回放
## 🔍 发生了什么 RLHF应用于扩散模型时反馈效率极低。本文发现奖励信息在扩散轨迹中分布不均,提出两个互补策略:(1)逐时间步加权方案,(2)基于优势的轨迹回放机制。在相同超参数下实现6倍样本效率提升。CVPR 2026 Workshop入选。 ## 💡 技术原理 - 关键洞察:并非所有去噪时间步/轨迹对学习奖励信号的贡献相等 - 逐时间步加权:在策略优化中强调信息量大的去噪步骤,理论连接PPO最优收敛 - 优势回放:优先回放高信息量轨迹,减少重复查询奖励模型 - 两个策略协同:加权聚焦 + 高效复用 ## 🔧 快速上手 在现有Diffusion RLHF框架(如Diffusion-DPO等)基础上集成两个模块:per-timestep weighting + advantage-based replay buffer。无需修改模型架构。 ## 🎯 应用场景 - 文生图模型人类偏好对齐 - 视频生成模型优化 - 3D资产生成对齐 - 减少人工评分/奖励模型查询成本 ## 🔗 相似技术 Diffusion-DPO、DPPO、DDPOH、RLHF for diffusion ## 💴 商业潜力 ⭐⭐⭐⭐ 6倍效率提升直接降低对齐训练成本。对图像/视频生成公司(Midjourney、Stability等)实用价值高。 ## 📚 学习路径 扩散模型基础 → RLHF原理 → Diffusion-DPO → 本文
🧠 CO-LMLM:360M参数模型在SimpleQA上媲美GPT-4o-mini和Claude Sonnet 4.5
## 🔍 发生了什么 有限记忆语言模型(LMLM)将事实知识外置到知识库而非权重中。CO-LMLM创新性地将连续键与文本知识值配对,摆脱了此前对关系型KB的依赖。仅360M参数的CO-LMLM在困惑度上超越了40倍数据量训练的常规LLM,在SimpleQA上达到GPT-4o-mini水平、超越Claude Sonnet 4.5。 ## 💡 技术原理 - 知识库使用连续向量键 + 可读文本值的配对 - 生成灵活向量查询,低成本检索 - 标注流水线:自动标注任意文本中的事实跨度(不限于维基百科) - 推理时按需从KB检索知识融入生成 ## 🔧 快速上手 预训练阶段需要构建带标注的知识库。推理时与常规LLM接口兼容,底层自动检索。适合对知识可控性要求高的场景。 ## 🎯 应用场景 - 知识可控的对话系统(医疗、法律、金融) - 轻量级但知识密集的端侧模型 - 知识热更新(改KB即更新知识,无需重训) - 减少幻觉 ## 🔗 相似技术 RETRO、kNN-LM、LMLM (最新方向)、RAG ## 💴 商业潜力 ⭐⭐⭐⭐⭐ 360M达到GPT-4o-mini级别事实精度 + 知识可控 + 热更新,对端侧AI和垂直领域落地极具价值。 ## 📚 学习路径 RAG基础 → RETRO/kNN-LM → LMLM论文 → CO-LMLM
📚 SkillCenter:21万+结构化技能库,自主AI Agent的知识底座
## 🔍 发生了什么 AI Agent常缺乏落地所需的操作知识,导致输出「可执行但不正确」。SkillCenter构建了已知最大的开放Agent技能库:216,938个结构化技能,横跨24个领域。核心创新是「来源溯源」保证——每条技能可追溯至原始文献精确引用。所有技能以SQLite FTS5格式离线可搜索。 ## 💡 技术原理 - 多源采集:同行评审期刊、ArXiv、24000+技术源 + GitHub/ClawHub社区 - SkillGate质量门:LLM驱动的多级质量过滤 - 模板驱动生成 + 迭代溯源校验 - 来源溯源(Traceability):每个保留声明映射到源文精确引文 - SQLite FTS5离线全文检索 ## 🔧 快速上手 直接使用:下载HuggingFace上的skillcenter-bundles数据集。集成:加载SQLite数据库,通过FTS5查询相关技能。GitHub: LabRAI/SkillCenter。 ## 🎯 应用场景 - Agent知识增强(代码生成、运维、数据分析等24个领域) - 企业知识管理系统 - RAG系统的结构化知识源 - Agent技能发现与组合 ## 🔗 相似技术 Voyager(Minecraft技能库)、ToolBench、AgentBench、Reflexion ## 💴 商业潜力 ⭐⭐⭐⭐ 直接提升Agent任务成功率和输出质量。对企业级Agent平台是即插即用的知识增强层。 ## 📚 学习路径 Agent基础 → RAG系统 → 技能发现机制 → SkillCenter代码
🏆 Agon:两个模型互为裁判的对弈式推理训练,GRPO性能翻倍
## 🔍 发生了什么 当前推理模型(如GRPO)只评判最终答案,导致模型在难题上「写得更多而非想得更好」。Agon让两个模型互为对手:交替解题并评判对方,隐式奖励推理过程质量,无需过程标签或奖励模型。在DeepMath难题集上pass@1翻倍,在竞赛编程和多模型家族(Qwen3.5、Gemma 4)上均复现。 ## 💡 技术原理 - 两个行为不同的模型交替扮演draft和reader角色 - 每次一方draft解题方案,另一方阅读后再解题 - 奖励信号:是否比对手解得更好 - 双方同步优化 → 对手持续变强 → 自我博弈式进步 - 推理时:stage1 draft → stage2 reader-based answer ## 🔧 快速上手 需要两个可比较强度但行为不同的模型(如Qwen3-7B和Qwen3-8B)。配置交替训练循环,定义可验证奖励函数。代码预期将开源。 ## 🎯 应用场景 - 数学推理模型训练 - 代码竞赛AI - 科研推理助手 - 任何需要深度推理的agent ## 🔗 相似技术 GRPO、AlphaGo自博弈、Debate (Irving et al.)、Self-Play Fine-Tuning (SPIN) ## 💴 商业潜力 ⭐⭐⭐⭐⭐ 推理能力翻倍+无需标注数据,对AI推理公司(OpenAI、DeepSeek等)核心竞争力有直接影响。成本仅为双模型训练。 ## 📚 学习路径 RLHF基础 → GRPO论文 → 自博弈理论 → Agon论文
🔑 Transformer线性化终极方案:分析驱动的线性化方法,已扩展至32B参数
## 🔍 发生了什么 因果自注意力的二次计算成本严重制约长上下文推理。本文在冻结骨干网络严格条件下,隔离了状态更新设计的影响,提出了sink token、短卷积和固定预算缓存路由等结构化干预,将线性化方法扩展至LLaMA和Qwen 32B模型,在MMLU上超越所有事后线性化基线。 ## 💡 技术原理 - 揭示softmax依赖key相关的rank-1正交投影,解释为何delta-style网络优于纯门控累加 - 引入sink token处理注意力分配异常 - 短卷积补偿线性化过程中的信息损失 - 固定预算缓存路由实现动态资源分配 ## 🔧 快速上手 无需训练,在已有LLaMA/Qwen模型上直接应用线性化pipeline。关键是正确设置sink token和缓存路由策略。 ## 🎯 应用场景 - 降低大模型推理成本(32B模型长文本推理) - 边缘设备部署大模型 - 实时长文档处理系统 ## 🔗 相似技术 Mamba(状态空间模型)、RWKV、GLA(Gated Linear Attention)、Lightning Attention ## 💴 商业潜力 ⭐⭐⭐⭐⭐ 直接降低推理成本数倍,对所有LLM服务商和部署方都有立竿见影的价值。无需重新训练即可应用。 ## 📚 学习路径 Transformer基础 → 线性注意力综述 → Mamba/GLA论文 → 本文
CVE-2026-40079: Cacti escape_command函数命令注入(CVSS 9.8)
开源监控框架Cacti 1.2.30及更早版本中lib/rrd.php的escape_command()函数实质为空操作,导致图形模板中的text_format值未经充分转义直接传入shell_exec,攻击者可注入任意命令。
NVDCVE-2025-67038: Lantronix EDS5000 OS命令注入(CVSS 9.8)
Lantronix EDS5000 2.1.0.0R3的HTTP RPC模块在认证失败时直接将用户名拼接到shell命令中,未经任何过滤处理,攻击者可注入任意操作系统命令实现远程控制。
CISA KEV / NVDCVE-2026-12569: PTC Windchill/FlexPLM 反序列化RCE(CVSS 9.8)
PTC Windchill PDMlink和FlexPLM存在关键远程代码执行漏洞,攻击者可通过反序列化不可信数据实现远程代码执行。该漏洞影响PLM/PDM工业管理系统,潜在影响面广泛。
CISA KEV / NVDCVE-2026-34910: Ubiquiti UniFi OS 命令注入漏洞(CVSS 10.0)
Ubiquiti UniFi OS存在输入验证不当漏洞,具有网络访问权限的恶意行为者可利用该漏洞执行命令注入攻击,实现远程代码执行。影响大量企业级网络设备。
CISA KEV / NVDCVE-2026-48558: SimpleHelp OIDC认证绕过漏洞(CVSS 10.0)
SimpleHelp 5.5.15及更早版本和6.0预发布版在OIDC认证流程中存在身份验证绕过漏洞,系统接受未验证密码学签名的身份令牌,攻击者可冒充任意用户登录远程管理平台。
CISA KEV / NVDCVE-2026-48282: Adobe ColdFusion 路径遍历致任意代码执行(CVSS 10.0)
Adobe ColdFusion 2025.9及2023.20及更早版本存在路径遍历漏洞,未经身份验证的远程攻击者可在当前用户上下文中执行任意代码。该漏洞无需用户交互即可被利用,已被CISA收录。
CISA KEV / NVDCVE-2026-48908: JoomShaper SP Page Builder 未授权文件上传导致RCE(CVSS 10.0)
JoomShaper SP Page Builder存在未授权任意文件上传漏洞,攻击者无需认证即可上传并执行PHP代码,实现远程代码执行。该漏洞已被CISA列入已知被利用漏洞目录,影响所有未升级版本。
CISA KEV / NVDDeepLearning.AI - Fast & Efficient LLM Inference with vLLM
学习使用vLLM进行高效LLM推理部署,涵盖PagedAttention、批处理优化等生产级技术。免费短课程,适合有LLM基础的工程师。
DeepLearning.AICoursera - Machine Learning Specialization (Andrew Ng)
Andrew Ng经典机器学习专项课程2024新版,涵盖监督学习、无监督学习和推荐系统。斯坦福出品,免费旁听,ML入门首选。
Coursera/DeepLearning.AIHuggingFace LLM Course - 大语言模型实战教程
HuggingFace官方LLM课程,从Transformer基础到微调部署全流程实战。使用最新HF生态工具链,完全免费开源。
HuggingFaceCoursera - Introduction to Artificial Intelligence (AI) by IBM
IBM出品的AI入门课程,涵盖AI基础概念、机器学习、深度学习和自然语言处理。免费旁听,适合零基础学习者建立AI知识框架。
Coursera/IBMFast.ai - Practical Deep Learning for Coders (2024版)
业界口碑最好的免费深度学习入门课程,从零开始用PyTorch构建完整DL项目。Jeremy Howard主讲,面向有编程基础的学习者,完全免费无门槛。
fast.aiDeepLearning.AI - AI Agents for Image and Video Generation
Andrew Ng团队最新课程,讲解如何用AI Agent生成图像和视频,涵盖多模态生成管线。Coursera平台免费旁听,付费可获证书。
DeepLearning.AIHuggingFace Agents Course - 免费AI智能体实战课程
HuggingFace官方免费AI Agent课程,涵盖LLM工具调用、多智能体协作等前沿内容。课程含实战项目,完成后可获社区认证徽章。
HuggingFacecodeburn — AI 编程 Token 用量追踪器
免费本地工具,追踪 31 种 AI 编程工具的 Token 用量和费用,按模型、项目、任务维度统计。无需注册,数据本地存储。
GitHub Trendingherdr — 终端 AI Agent 多路复用器
在终端中同时管理多个 AI 编程 Agent 的多路复用器,支持并行调度、任务分发。适合需要同时操作多个 Agent 协作开发的场景。
GitHub TrendingOpenCLI — 把任意网站变成命令行工具
将任意网页转化为 CLI 命令,并可利用浏览器已登录状态进行 AI Agent 操作。解决需要登录态的 API 场景,无需手动管理 Cookie。
GitHub Trendingcodebase-memory-mcp — 高性能代码智能 MCP 服务
将代码库索引为持久化知识图谱的 MCP 服务器,支持 158 种语言,毫秒级查询,Token 消耗减少 99%。单静态二进制,零依赖,适合大规模代码库。
GitHub TrendingAgent-Reach — AI Agent 全网信息采集 CLI
赋予 AI Agent 访问 Twitter、Reddit、YouTube、GitHub、Bilibili、小红书等平台的能力,一行命令、零 API 费用。让 Agent 具备实时联网搜索和内容抓取能力。
GitHub TrendingGraphify — 代码库知识图谱生成器
将任意代码仓库、SQL Schema、脚本一键转化为可查询的知识图谱,支持 Claude Code / Codex / Cursor 等主流 AI 编程工具。让 AI Agent 真正理解你的项目结构。
GitHub Trendingrtk — LLM Token 消耗优化 CLI 代理
用 Rust 编写的 CLI 代理,可将常用开发命令的 LLM Token 消耗降低 60-90%。单二进制文件零依赖,开箱即用,适合重度使用 AI 编程助手的开发者节省成本。
GitHub Trending苹果20亿美元收购AI公司Q.ai,加码AI战略布局
苹果公司以20亿美元收购AI公司Q.ai,这是苹果在AI领域最大规模的收购之一。此举显示苹果正加速追赶Google和微软在AI领域的领先地位。
投资界金融科技公司Ramp融资7.5亿美元,估值440亿美元
企业支出管理平台Ramp完成7.5亿美元融资,估值飙升至440亿美元。Ramp凭借AI驱动的财务管理功能获得投资者青睐,体现AI赋能金融科技的巨大市场潜力。
TechCrunchShield AI收购Aechelon并融资20亿美元,估值127亿美元
防务AI公司Shield AI宣布收购仿真软件公司Aechelon,同时完成20亿美元融资,估值达127亿美元。此次收购将增强其自主飞行系统的模拟能力,防务AI整合趋势加速。
Shield AITogether AI融资8亿美元,估值83亿美元
开源AI基础设施公司Together AI完成8亿美元融资,估值达83亿美元。作为AI推理和训练平台,Together AI持续获得资本追捧,反映市场对AI基础设施的强劲需求。
ReutersAI芯片公司SambaNova融资10亿美元,估值达110亿美元
NVIDIA挑战者SambaNova完成10亿美元融资,估值达110亿美元,距上一轮仅5个月。投资者持续看好AI芯片替代方案,芯片赛道竞争加剧。
TechCrunch / CNBC防务科技巨头Anduril融资50亿美元,估值翻倍至610亿美元
美国防务科技公司Anduril完成50亿美元融资,估值从300亿美元翻倍至610亿美元,同时拓展太空业务支持特朗普'金穹'防御计划。防务科技赛道持续火热。
SiliconANGLE马斯克将SpaceX与xAI合并,打造太空+AI超级集团
Elon Musk正式将SpaceX与其AI初创公司xAI进行合并,xAI此前已完成200亿美元融资。此举将太空探索能力与AI技术深度整合,创建前所未有的太空AI超级集团。
The New York TimesAnthropic融资650亿美元逼近万亿美元估值,秘密提交IPO申请
AI巨头Anthropic完成650亿美元融资,估值达9650亿美元,已秘密向SEC提交IPO申请文件。这是AI行业有史以来最大单轮融资,标志着Anthropic正式超越OpenAI成为最有价值的AI初创公司。
TechCrunch / FortuneWhen Does In-Context Search Help? 反思驱动推理的采样复杂度理论
🔍 发生了什么:Amnon Shashua(Mobileye创始人)团队给出in-context search的理论分析——当反思能可靠定位早期错误时,上下文内搜索可实现指数级改进;反之则与并行采样无异。证明了这些增益是可学习的。 💡 技术原理:将in-context search建模为推理轨迹上的近似推理,基础模型定义先验,自我反思提供后验更新的反馈。关键定理:当反思能定位早期错误时,多项式次尝试即可解决零-shot通过率指数小的问题。跨熵训练搜索轨迹可恢复所需行为。 🔧 快速上手:理论指导实践——设计反思机制时,确保它能准确指出"哪一步出了错",而不仅仅是"答案不对"。这比简单的self-consistency投票更有效。 🎯 应用场景:推理模型训练策略设计、test-time compute优化、反思机制工程、reasoning model评估。 🔗 相似技术:Tree-of-Thought、Self-Refine、STaR、Reflection agents。 💴 商业潜力:★★★★☆ 理论成果对推理模型(o1/o3/DeepSeek-R1类)的训练和部署策略有直接指导意义。 📚 学习路径:理解贝叶斯推理基础 → 学习in-context learning理论 → 研究reasoning model训练 → 实践反思机制设计。
ARC-AGI-1上高效Agent: 无需微调用架构设计提升52分
🔍 发生了什么:在ARC-AGI-1基准上,不进行任何ARC特定微调,仅通过Agent编排架构设计,用DeepSeek V3.2(非思考模式)将一次基准从15.50%提升到67.25% pass@2,每任务仅$0.62。揭示了Agent是"生成受限"而非"选择受限"的关键洞察。 💡 技术原理:Explorer-Definer Pipeline将模式发现与可执行变换合成分离为两阶段;Reflective Orchestrator在假设失败时自主探索新变换。关键发现:选择机制可捕获~95%的候选上限,真正的瓶颈是生成多样性。反思型编排器通过自适应重新探索确认了这一预测。 🔧 快速上手:将复杂推理任务分解为"模式发现"和"程序合成"两个阶段,失败时增加生成多样性而非改进排序,think工具是重要组件。 🎯 应用场景:抽象推理、模式识别、数据变换任务、Agent架构设计最佳实践。 🔗 相似技术:ARC-AGI挑战赛其他方案、FunSearch、AlphaProof。 💴 商业潜力:★★★★☆ 虽然ARC是基准测试,但其架构设计原则(分离探索/定义、反思重试)对所有Agent系统都有参考价值。 📚 学习路径:了解ARC-AGI挑战 → 学习程序合成 → 研究Agent编排模式 → 实践反思型架构。
Large Behavior Model: 用LLM构建零售客户数字孪生
🔍 发生了什么:提出大型行为模型(LBM),直接从大规模零售交易数据中学习客户决策模式,构建可提示的客户数字孪生。通过持续预训练+监督微调+可验证奖励强化学习三阶段训练,在购买预测、篮子完成、促销响应等任务上超越通用大模型。 💡 技术原理:用Person-Environment统一公式建模客户行为——客户状态由历史购买行为画像表示,产品上下文通过RAG引入。三阶段训练:行为数据持续预训练→决策生成SFT→基于行为证据的RL校准。 🔧 快速上手:核心是将交易历史转化为自然语言行为描述,用LLM学习其中的决策模式。关键发现是持续预训练是行为泛化的主要驱动力,RAG在训练和推理时都应使用。 🎯 应用场景:个性化推荐、精准营销、促销策略优化、客户流失预测、零售仿真模拟。 🔗 相似技术:用户行为序列建模、DIFM、基于Transformer的推荐系统。 💴 商业潜力:★★★★★ 零售AI是万亿级市场,数字孪生概念在营销领域极具吸引力,且模型展示了跨零售商零样本迁移能力。 📚 学习路径:了解推荐系统基础 → 学习用户行为建模 → 研究RLHF/RLEF → 实践LBM。
MILES: 模块化指令记忆实现LLM推理自我提升
🔍 发生了什么:提出MILES框架,让LLM在推理过程中动态积累可复用的经验记忆,而非像现有方法那样每次从零开始。通过粗-细两级检索机制和可学习的选择头,在测试时持续优化推理能力。 💡 技术原理:维护模块化记忆单元——由子目标嵌入和子指令的非对称对组成,每个关联一个可学习的选择头。粗粒度检索用于记忆扩展和监督采集,细粒度检索用学习到的选择头重排候选并引导推理。 🔧 忥速上手:核心思想是将成功的推理步骤抽象为可检索的记忆片段,新问题到达时先检索相关经验再推理,逐步积累形成Agent的"经验库"。 🎯 应用场景:数学推理、代码生成、复杂问答等需要逐步推理的任务,特别适合问题持续到来的流式场景。 🔗 相似技术:Reflexion、Voyager技能库、MemGPT、ExpeL。 💴 商业潜力:★★★★☆ 测试时自我提升是降低推理成本的关键方向,记忆复用可显著减少重复计算。 📚 学习路径:理解CoT推理 → 学习检索增强生成(RAG) → 研究记忆机制设计 → 实践MILES框架。
AgentLens: 评估AI编程Agent的完整轨迹而非只看结果
🔍 发生了什么:提出AgentLens基准测试,不再用单一通过/失败评判代码Agent,而是评估整个交互轨迹——包括指令遵循、工具使用、自我验证、错误恢复和用户沟通质量。结合形式化验证与LLM轨迹评审,生成可读的评分解释。 💡 技术原理:将形式化验证(客观检查存在时)与LLM编写的轨迹评审和并排对比相结合。每个运行产生一个可读的评分解释文档,支持模型行为诊断、版本回归检测和夜间评估流水线。 🔧 快速上手:开源项目 github.com/agent-lens/agent-lens-bench,可直接集成到CI/CD流水线中,用于持续监控编程Agent质量。 🎯 应用场景:AI编程助手(Copilot/Cursor/Cline)的质量评估、Agent版本迭代监控、产品回归检测。 🔗 相似技术:SWE-bench、HumanEval、BigCodeBench(但这些只看结果不看过程)。 💴 商业潜力:★★★★☆ Agent评估是刚需市场,尤其在AI编程助手竞争白热化的当下。 📚 学习路径:了解SWE-bench → 研究轨迹评估方法论 → 部署AgentLens → 构建自定义评估pipeline。
The Harness Effect: 编排层设计决定企业AI Agent的Token经济学
🔍 发生了什么:Writer团队发布大规模实证研究,证明在企业Agent系统中,编排层(harness)比模型选择本身更能影响成本。同一个编排框架让6个不同模型的单任务成本降低33-61%,Token消耗降低38%,延迟降低44%,且质量持平。 💡 技术原理:编排层通过6大机制降本——缓存形状优化、上下文窗口管理、工具调用编排、任务分解、失败治理、token预算控制。核心发现是"质量每美元"提升82%,且效率增益与模型无关。 🔧 快速上手:检查你的Agent编排层是否存在token浪费——上下文重复、冗余工具调用、无token预算上限。优化这些比换模型更有效。 🎯 应用场景:企业级Agent平台、SaaS AI产品、客服/营销/数据分析Agent。对所有按token计费的AI产品都有直接参考价值。 🔗 相似技术:LangChain/LlamaIndex编排层、Semantic Kernel、CrewAI。 💴 商业潜力:★★★★★ 论文直接量化了编排层的ROI,对所有AI产品团队都有决策参考价值。 📚 学习路径:理解Agent编排架构 → 学习token经济学 → 研究prompt caching → 实践编排层优化。
EvoSOP: 让AI Agent自动将原子操作进化为标准操作流程
🔍 发生了什么:提出EvoSOP框架,让LLM Agent从执行轨迹中自动提取标准操作流程(SOP),通过构建→合并→评估→裁剪的生命周期实现工具集的自我进化,任务成功率显著提升且交互轮次大幅减少。 💡 技术原理:将原子操作(如文件IO、单轮搜索)合成为封装多步逻辑的高阶SOP工具。通过执行轨迹提取SOP,迭代优化工具集——包括构建新SOP、合并相似SOP、评估SOP效果、裁剪低效SOP。 🔧 快速上手:论文开源,核心思路是记录Agent执行轨迹,用LLM从中提取可复用的多步流程模板,然后在新任务中直接调用这些SOP代替逐步推理。 🎯 应用场景:企业级AI Agent开发、自动化工作流编排、DevOps自动化、RPA增强。任何需要Agent反复执行类似任务的场景都能受益。 🔗 相似技术:Voyager(Minecraft技能库)、Toolformer、AutoGPT工具链。 💴 商业潜力:★★★★★ 直接降低企业Agent的推理成本和失败率,是最具落地价值的Agent自进化方向之一。 📚 学习路径:了解ReAct/Toolformer → 研究Agent执行轨迹记录 → 学习SOP抽象与复用 → 实践EvoSOP。
AwanLLM: 免费Lite层,无限Token,自有数据中心
LLM推理API平台,免费Lite层:无限Token,200次/天(小模型),10次/天(中大模型),20 RPM。自有数据中心,不记录日志。订阅制而非按Token计费。
alpha-feedVoyage AI: 2亿免费Token嵌入API,voyage-4系列
顶级嵌入模型提供商。voyage-4系列每个账户免费2亿Token(含voyage-4-large/4/4-lite/context-3/code-3)。多模态模型额外送2亿文本Token+1500亿像素。
alpha-feedJina AI: 100万免费Token,多模态嵌入/Reader API
顶级多模态多语言长上下文嵌入API。新用户送100万Token(CC-BY-NC非商用),原型开发可获10亿Token。Reader API可将网页转为LLM友好格式。OpenAI兼容。
alpha-feedDeepInfra: $5免费推理额度,40+开源模型,1M tokens/天
AI推理云平台,注册送$5额度(促销可达$20)。支持40+开源模型(Llama 3.3/Mistral/DeepSeek等),免费模型每天1M tokens。OpenAI兼容API。已完成$1.07亿B轮融资。
alpha-feedFreeTokenRouter.cn: 100万免费Token,国内大模型聚合平台
国内AI Token聚合平台,注册送100万Token,每日签到可续,邀请好友翻倍。支持DeepSeek/通义千问/智谱AI/月之暗面/腾讯混元/百度文心/MiniMax等国内主流大模型。OpenAI兼容API,企业赞助Token模式。
alpha-feed📢 火山引擎(豆包): 每日200万token永久免费,支持DeepSeek/Kimi
火山引擎豆包API每日200万token永久免费(支持豆包系列/DeepSeek-V3.2/Kimi-K2等主流模型)。每个新开通模型赠送50万token新人包。新增Doubao-Seed-2.0 Lite免费变体。
alpha-feed📢 Google Gemini: 新增3.5 Flash/4.0/3.1 Flash TTS,Pro移除免费层
Google Gemini新增Gemini 3.5 Flash(289tps/1M上下文)、Gemini 4.0(原生多模态)、3.1 Flash-Lite预览版(15RPM/500RPD)、3.1 Flash TTS(免费文本转语音)。⚠️ Gemini 2.5 Pro及3.1 Pro自2026-04-01移除免费层。
alpha-feed📢 阿里云百炼: 有效期延至180天,上架第三方模型
阿里云百炼免费额度有效期从90天延长至180天。已上架智谱GLM-5.1/MiniMax M2.7/Kimi K2.6等第三方模型。新增Qwen3.5-Omni/Qwen3-Coder-Plus。Coding Plan Lite首月7.9元无限调用Qwen3-Coder。
alpha-feed⚠️ 腾讯混元: HY 2.0等46个旧模型今日下线,平台9月30日停服
腾讯混元HY 2.0等46个旧模型已于2026-06-22下线。原平台将于2026-09-30全面停服,迁移至TokenHub。HY2.0输入价格涨463%。Hunyuan-Lite永久免费不限量。微信小程序成长计划赠1亿混元token(2026年底前)。
alpha-feed🆕 Kilo Code: 开源AI编码Agent可免费使用
Kilo Code是开源AI编码Agent(VS Code/JetBrains/CLI),300万+开发者。可通过自带API Key免费使用5个模型。Apache 2.0开源。
alpha-feed🆕 LLM7.io: 统一AI API网关6个免费模型
LLM7.io统一AI API网关,6个免费模型(全部在线),无需信用卡,一个endpoint接入多个模型。
alpha-feed🆕 Aion Labs: 以色列AI永久免费API(角色扮演/叙事)
以色列AI公司Aion Labs提供永久免费推理API,15 RPM/20K tokens/天,5个免费模型,无需信用卡。专注于角色扮演和叙事场景。OpenAI兼容。
alpha-feed🆕 OVHcloud AI Endpoints: 欧洲云40+开源模型免费Beta推理
欧洲云厂商OVHcloud推出AI Endpoints服务端推理API,Beta期间免费。40+开源模型(Llama/Qwen/DeepSeek等),欧洲数据驻留,OpenAI兼容接口,无需信用卡。12个免费模型。
alpha-feedCompletions.me更新:支持GPT-5.4/Claude Sonnet 4/Opus 4.x
免费无限AI API Completions.me更新模型列表,现支持GPT-5.4、Claude Sonnet 4、Claude Opus 4.x、Gemini 3.1 Pro等15+模型。无需验证。
alpha-feedNVIDIA NIM免费模型增至139个
NVIDIA NIM免费模型从100+增至139个,含DeepSeek-V4 Pro/Kimi-K2.5/GLM-5.1/Llama-4/MiniMax-M3等。纯速率限制(40 RPM),OpenAI兼容。
alpha-feed🆕 Exa Web Search API:每月20,000次免费请求
AI web search API提供商Exa免费层提供20,000请求/月。2026-06-16推出Exa Agent产品。支持语义搜索、内容提取。exa.ai
alpha-feed⚠️ LongCat(美团龙猫)下线6个旧模型,免费额度大幅缩减
2026-05-29 LongCat下线Flash-Chat/Flash-Thinking/Flash-Lite/Flash-Omni等6个旧模型。Flash-Lite原提供每日5000万Token免费,已不可用。仅保留LongCat-2.0-Preview(限量beta)。原每日5500万Token免费政策已失效。
alpha-feed