SHOEISHA iD

※旧SEメンバーシップ会員の方は、同じ登録情報(メールアドレス&パスワード)でログインいただけます

DeveloperZine(デベロッパージン)- エンジニアの意思決定を支える技術情報メディア ProductZine

CodeZine編集部では、現場で活躍するデベロッパーをスターにするためのカンファレンス「Developers Summit」や、エンジニアの生きざまをブーストするためのイベント「Developers Boost」など、さまざまなカンファレンスを企画・運営しています。

LM Studio×AnythingLLMで構築する「ハイブリッドAI」活用術

LM StudioでローカルLLMを起動し、マシン性能と設定の「リアル」を検証する

LM Studio×AnythingLLMで構築する「ハイブリッドAI」活用術 第2回

モデルの選択とインストール

 LM Studioを使う上で特に便利な点は、モデルの選択とインストールが簡単なことです。

モデルのインストール

 モデルの選択とインストールは、図7のように行います。

図7:モデルの選択とインストール画面
図7:モデルの選択とインストール画面

 「MLX」は、Apple Silicon向けに最適化されたモデル形式です。選択肢に「MLX」がある場合は、そちらを選択すると、Apple Siliconに適した形式のモデルを利用できます。ただし、GGUF版でもApple Siliconの性能を十分に活かせるため、MLXでなければ性能が出ないわけではありません。

使える機能の選択

 各モデルによって、以下の機能を利用できる場合とできない場合があります。

  • Vision:入力に画像を利用できます
  • Tool Use:MCPやFunction Callingなどの外部連携が可能です
  • Reasoning:推論モードが利用可能です(チャットでは「Think」と表示されます)

 例えば、gemma4であれば図8のようにこれらのすべての機能が利用出来ます。

図8:モデルの選択とインストール画面
図8:モデルの選択とインストール画面

 チャットを前提に、ローカルLLMでできることを評価したいのであれば、これらの機能をすべて利用できるモデルを選んだ方がよいでしょう。

モデルを使ってみる

 ローカルLLMのベンチマークとして、まずは「前回の内容(約6000文字)を500文字以内で要約する」というタスクを実行します。一定量のコンテキストを読み込み、ある程度の量の文章を生成するため、ローカルLLMの性能を確認する題材として適しています。

 すると、チャットでの結果の後に、図9の情報が表示されます。

図9:チャットの性能評価の情報
図9:チャットの性能評価の情報

 ここでは、次の情報を確認できます。

  • 回答が表示され始めるまでの時間
  • 回答の生成速度
  • 生成されたトークン数

 表示された図の意味は以下のようになります。

  • トークンの出力生成時間:45.59トークン/秒
  • 出力されたトークン数:465トークン
  • 出力が開始されるまでの時間(Time to First Token:TTFT):9.92s

 したがって、回答全体が表示されるまでの時間は、TTFTと生成時間を合計して、次のように計算できます。

 9.92秒+(465トークン÷45.59トークン/秒)≒20秒

ハード性能の違い

 以下は、同じモデル・同じプロンプトを使っておおよそ同程度(450前後)の出力トークンになった場合で測定した結果です。

表1:各ハードごとの性能の違い
環境 トークン速度 TTFT 総時間
M1 Mac Studio(メモリ32GByte) 40–45 tok/s 8–10s 約20s
M2 MacBook Air(メモリ24GByte) 10–15 tok/s 約20s 約60s
Snapdragon X Plus(メモリ32GByte) 10–15 tok/s 約60s 約90s

 インタラクティブなチャットとして利用する場合、応答が完了するまでに30秒以上かかる状態は、実務での運用には耐えにくいラインと言えるでしょう。そのため、もし筆者がM2 MacBook Airを基準にローカルLLMの評価をしようとした場合、ローカルLLMは使えないという決断をしてしまうと思います。

 また、Snapdragon X Plusなどの最新チップはNPUを搭載しており、WindowsのCopilot機能などを動かす潜在的なAI性能(TOPS)は十分に備わっています。

 しかし、「Copilot対応PCなので、ローカルLLMも快適に動く」とは限りません。LM Studioなどの汎用ツールが依存しているオープンソースのLLMエンジン(llama.cppなど)が、これらのNPUやGPUをフル活用するための最適化処理に未対応(または途上)だからです。

 その結果、ハードウェアが持つ潜在能力を十分に引き出せず、CPU中心の低速な処理に留まってしまうことがあります。これが、現在のローカルLLM環境における課題の一つです。

 また、単に生成速度が遅いだけであれば「待てばよい」で済みますが、TTFT(最初の1トークン目が出るまでの時間)が遅い場合は用途が大きく限定されます。API経由で外部アプリから呼び出す際、TTFTが長すぎるとタイムアウトエラーが発生しやすくなるためです。

 デスクトップアプリ単体で気長に待つ分には問題なくても、将来的にシステムへの組み込みやAPI連携(ハイブリッド利用)へ発展させようとした場合、この応答遅延は大きな障壁となります。

次のページ
その他の制限と機能

この記事は参考になりましたか?

LM Studio×AnythingLLMで構築する「ハイブリッドAI」活用術連載記事一覧
この記事の著者

WINGSプロジェクト 小林 昌弘(コバヤシ マサヒロ)

< WINGSプロジェクト について> 有限会社 WINGSプロジェクト が運営する、テクニカル執筆コミュニティ(代表 ...

※プロフィールは、執筆時点、または直近の記事の寄稿時点での内容です

山田 祥寛(ヤマダ ヨシヒロ)

静岡県榛原町生まれ。一橋大学経済学部卒業後、NECにてシステム企画業務に携わるが、2003年4月に念願かなってフリーライターに転身。Microsoft MVP for Visual Studio and Development Technologies。執筆コミュニティ「WINGSプロジェクト」代表。主な著書に「独習シリーズ(Java・C#・Python・PHP・Ruby・JSP&サーブレットなど)」「速習シリーズ(ASP.NET Core・Vue.js・React・TypeScript・ECMAScript、Laravelなど)」「改訂3版JavaScript本格入門」「これからはじめるLaravel実践入門」「はじめてのAndroidアプリ開発 Kotlin編 」他、著書多数。

※プロフィールは、執筆時点、または直近の記事の寄稿時点での内容です

この記事は参考になりましたか?

この記事をシェア

CodeZine(コードジン)
https://codezine.jp/article/detail/29739 2026/09/29 09:00

イベント

CodeZine編集部では、現場で活躍するデベロッパーをスターにするためのカンファレンス「Developers Summit」や、エンジニアの生きざまをブーストするためのイベント「Developers Boost」など、さまざまなカンファレンスを企画・運営しています。

新規会員登録無料のご案内

  • ・全ての過去記事が閲覧できます
  • ・会員限定メルマガを受信できます

メールバックナンバー