PUBLIC

Chapter 3 結局、どれを使えばいいのか / 3-1

Ollamaとllama.cppは競合していない

実行環境は3層に分かれる。この構造が分かると大半の疑問が解ける。

Ollama、LM Studio、llama.cpp、vLLM、SGLang、MLX、TensorRT-LLM。全部が横並びの選択肢に見えて、どれを選べばいいのか分からない。

比較記事を読んでも「Ollamaは手軽、vLLMは高速」みたいな話ばかりで、なんだかスッキリしない。

原因はここです。これらは、同じ土俵にいません。

LAYER 01: UI & RUNTIME (ユーザー向け管理層)
モデルのダウンロード、対話UI、REST APIの口を提供。中身の行列計算は下のエンジンへ委ねる。OllamaLM StudioOpenWebUI / Local Apps呼び出しLAYER 02: INFERENCE ENGINE (推論計算エンジン)重みファイルの展開、トークン化、KVキャッシュ管理、テンソル演算の実行を受け持つ。手元・1人向け (GGUF / 低メモリ)llama.cpp / MLXサーバ・複数人向け (高スループット)vLLM / SGLang / TensorRT-LLMLAYER 03: HARDWARE & ACCELERATORSNVIDIA GPU (CUDA) / Apple Silicon (Metal/MPS) / AMD ROCm / CPU (AVX-512)
OllamaとLM Studioは、推論エンジンの上に乗った「皮」。競合しているのではなく、呼び出す側と呼び出される側の関係。

この構造が分かると、疑問が解ける

なぜOllamaでは細かいパラメータが触れないのか

皮の部分で選択肢を絞っているからです。エンジン自体はもっと多くの設定を持っています。

LM Studioで動いたモデルは、llama.cppでも動くのか

動きます。同じエンジンなので。

OllamaとvLLM、どっちが速いのか

質問が成立していません。層が違うので、比べるならllama.cpp対vLLMです。

推論エンジンには、思想の違う2系統がある

手元で動かす系統サーバとして動かす系統
代表llama.cpp, MLXvLLM, SGLang, TensorRT-LLM
前提1人が使う多数のリクエストを捌く
動く環境Mac・NVIDIA・AMD・CPUほぼNVIDIA専用
強みどこでも動く、軽い同時実行がめちゃくちゃ強い

結論

個人利用なら手元系統で十分です。なぜそう言い切れるのかは、バッチ処理の原理を扱う「サーバ系エンジンが存在する理由」で数字とともに説明します。