Ollama、LM Studio、llama.cpp、vLLM、SGLang、MLX、TensorRT-LLM。全部が横並びの選択肢に見えて、どれを選べばいいのか分からない。
比較記事を読んでも「Ollamaは手軽、vLLMは高速」みたいな話ばかりで、なんだかスッキリしない。
原因はここです。これらは、同じ土俵にいません。
この構造が分かると、疑問が解ける
なぜOllamaでは細かいパラメータが触れないのか
皮の部分で選択肢を絞っているからです。エンジン自体はもっと多くの設定を持っています。
LM Studioで動いたモデルは、llama.cppでも動くのか
動きます。同じエンジンなので。
OllamaとvLLM、どっちが速いのか
質問が成立していません。層が違うので、比べるならllama.cpp対vLLMです。
推論エンジンには、思想の違う2系統がある
| 手元で動かす系統 | サーバとして動かす系統 | |
|---|---|---|
| 代表 | llama.cpp, MLX | vLLM, SGLang, TensorRT-LLM |
| 前提 | 1人が使う | 多数のリクエストを捌く |
| 動く環境 | Mac・NVIDIA・AMD・CPU | ほぼNVIDIA専用 |
| 強み | どこでも動く、軽い | 同時実行がめちゃくちゃ強い |
結論
個人利用なら手元系統で十分です。なぜそう言い切れるのかは、バッチ処理の原理を扱う「サーバ系エンジンが存在する理由」で数字とともに説明します。
