モデルの選択とインストール
LM Studioを使う上で特に便利な点は、モデルの選択とインストールが簡単なことです。
モデルのインストール
モデルの選択とインストールは、図7のように行います。
「MLX」は、Apple Silicon向けに最適化されたモデル形式です。選択肢に「MLX」がある場合は、そちらを選択すると、Apple Siliconに適した形式のモデルを利用できます。ただし、GGUF版でもApple Siliconの性能を十分に活かせるため、MLXでなければ性能が出ないわけではありません。
使える機能の選択
各モデルによって、以下の機能を利用できる場合とできない場合があります。
- Vision:入力に画像を利用できます
- Tool Use:MCPやFunction Callingなどの外部連携が可能です
- Reasoning:推論モードが利用可能です(チャットでは「Think」と表示されます)
例えば、gemma4であれば図8のようにこれらのすべての機能が利用出来ます。
チャットを前提に、ローカルLLMでできることを評価したいのであれば、これらの機能をすべて利用できるモデルを選んだ方がよいでしょう。
モデルを使ってみる
ローカルLLMのベンチマークとして、まずは「前回の内容(約6000文字)を500文字以内で要約する」というタスクを実行します。一定量のコンテキストを読み込み、ある程度の量の文章を生成するため、ローカルLLMの性能を確認する題材として適しています。
すると、チャットでの結果の後に、図9の情報が表示されます。
ここでは、次の情報を確認できます。
- 回答が表示され始めるまでの時間
- 回答の生成速度
- 生成されたトークン数
表示された図の意味は以下のようになります。
- トークンの出力生成時間:45.59トークン/秒
- 出力されたトークン数:465トークン
- 出力が開始されるまでの時間(Time to First Token:TTFT):9.92s
したがって、回答全体が表示されるまでの時間は、TTFTと生成時間を合計して、次のように計算できます。
9.92秒+(465トークン÷45.59トークン/秒)≒20秒
ハード性能の違い
以下は、同じモデル・同じプロンプトを使っておおよそ同程度(450前後)の出力トークンになった場合で測定した結果です。
| 環境 | トークン速度 | TTFT | 総時間 |
|---|---|---|---|
| M1 Mac Studio(メモリ32GByte) | 40–45 tok/s | 8–10s | 約20s |
| M2 MacBook Air(メモリ24GByte) | 10–15 tok/s | 約20s | 約60s |
| Snapdragon X Plus(メモリ32GByte) | 10–15 tok/s | 約60s | 約90s |
インタラクティブなチャットとして利用する場合、応答が完了するまでに30秒以上かかる状態は、実務での運用には耐えにくいラインと言えるでしょう。そのため、もし筆者がM2 MacBook Airを基準にローカルLLMの評価をしようとした場合、ローカルLLMは使えないという決断をしてしまうと思います。
また、Snapdragon X Plusなどの最新チップはNPUを搭載しており、WindowsのCopilot機能などを動かす潜在的なAI性能(TOPS)は十分に備わっています。
しかし、「Copilot対応PCなので、ローカルLLMも快適に動く」とは限りません。LM Studioなどの汎用ツールが依存しているオープンソースのLLMエンジン(llama.cppなど)が、これらのNPUやGPUをフル活用するための最適化処理に未対応(または途上)だからです。
その結果、ハードウェアが持つ潜在能力を十分に引き出せず、CPU中心の低速な処理に留まってしまうことがあります。これが、現在のローカルLLM環境における課題の一つです。
また、単に生成速度が遅いだけであれば「待てばよい」で済みますが、TTFT(最初の1トークン目が出るまでの時間)が遅い場合は用途が大きく限定されます。API経由で外部アプリから呼び出す際、TTFTが長すぎるとタイムアウトエラーが発生しやすくなるためです。
デスクトップアプリ単体で気長に待つ分には問題なくても、将来的にシステムへの組み込みやAPI連携(ハイブリッド利用)へ発展させようとした場合、この応答遅延は大きな障壁となります。
