本地大模型部署方案对比
llama.cpp、Ollama 与 vLLM 的适用边界。
三个方案的定位不同
llama.cpp
C++ 实现,量化支持最全,CPU 也能跑。适合单机、离线、资源受限的场景。
Ollama
llama.cpp 的封装,模型管理与 API 开箱即用。适合个人使用与快速验证。
ollama run qwen2.5:7b
vLLM
面向服务端,PagedAttention + 连续批处理,吞吐远超前两者。适合多并发的生产服务。
| 方案 | 单请求延迟 | 并发吞吐 | 部署复杂度 |
|---|---|---|---|
| llama.cpp | 中 | 低 | 低 |
| Ollama | 中 | 低 | 极低 |
| vLLM | 低 | 高 | 中 |
常见误区是拿 Ollama 直接扛生产流量。它没有连续批处理,并发一上来延迟会急剧劣化。
评论0





暂无评论,期待您的发言...