#inference
共 10 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 1
情报动态 9
学习 🟢
DominoTree: 路径条件草稿树实现6.6x推理解码加速
在Qwen3-4B上实现最高6.6x加速,平均接受长度10.7token/轮。CUDA原生构建器保证比特级一致,Alpaca上throughput +22%。直接可部署的推理加速方案。
ai_tokens 🟢
AwanLLM: 免费Lite层,无限Token,自有数据中心
LLM推理API平台,免费Lite层:无限Token,200次/天(小模型),10次/天(中大模型),20 RPM。自有数据中心,不记录日志。订阅制而非按Token计费。
ai_tokens 🟢
DeepInfra: $5免费推理额度,40+开源模型,1M tokens/天
AI推理云平台,注册送$5额度(促销可达$20)。支持40+开源模型(Llama 3.3/Mistral/DeepSeek等),免费模型每天1M tokens。OpenAI兼容API。已完成$1.07亿B轮融资。
ai_tokens 🟢
小米MiMo-V2.5-Pro-UltraSpeed发布:1T参数模型突破1000 TPS
小米与TileRT合作发布MiMo-V2.5-Pro-UltraSpeed,首次在1万亿参数模型上实现1000 tokens/s解码速度。API通过百炼平台开放,需申请。百炼平台100万tokens免费(90天)。
ai_tokens 🟢
NVIDIA NIM 2026年取消Credits限制改为纯速率限制模式
NVIDIA NIM自2026年起取消此前的1000 Credits注册赠送模式,改为纯速率限制。支持100+免费模型包括DeepSeek-V4 Pro、Kimi-K2.5、GLM-5.1、Llama-4、Nemotron-3等,OpenAI 100%兼容格式,无需绑信用卡。
GitHub 🟢
ds4 — DeepSeek本地推理引擎 by antirez (13.5K⭐)
Redis作者antirez新作,DeepSeek 4 Flash/PRO本地推理引擎。支持Metal/CUDA/ROCm三大GPU后端,C语言实现,极简高性能。