本地大模型安全部署:Ollama/vLLM 的暴露面收敛
高频风险:未授权访问
Ollama、vLLM 等本地推理平台默认监听所有接口且无认证,部署到云服务器后几乎等于公开接口。常见事故模式:
- 端口被扫描后,攻击者直接调用模型 API(模型被白嫖、配额被耗尽);
- 部分平台 API 支持拉取/替换模型,甚至可被用于反弹攻击;
- 推理平台通常与数据、存储同网络,暴露即横向风险。
安全基线配置清单
- 绑定回环地址:默认只监听 127.0.0.1,通过反向代理暴露;
- 代理层认证:在 Nginx/网关层加 API Key 或 mTLS;
- 网络隔离:放入私有子网,仅白名单来源可访问;
- 禁用危险接口:按需关闭模型拉取、删除、上传类接口;
- 配额与审计:配置 token/请求配额,记录访问日志。
额外建议
- 容器部署时最小化镜像,禁止 root 运行;
- 模型权重与缓存目录加密/限制权限;
- 将推理平台纳入资产清单与月度巡检。
小结
本地大模型的价值在于"数据不出域",但如果管理接口裸奔,数据照样被拿走。收敛暴露面,是本地 AI 部署的第一条安全基线。
评论