OpenAIやGeminiなどのAIベンダーAPIとの違い
ここまで使ってみたところで、OpenAIやGeminiなどのAPIを使った場合と比べてみます。
性能の違い
OpenAI(GPT 5.4 Mini)と、Google Gemini(Gemini 3.5 Flash Lite)を使って、ローカルLLMと同様のベンチマークをとってみたところ、以下の結果になりました。
- OpenAI:トータル4.75秒(134トークン/秒)
- Google:Gemini - トータル3.37秒(210トークン/秒)
実際に計測した環境がAnything LLMというアプリケーションを使っての計測なので、個別の項目で詳しく違いを比べられませんが、しかし、いずれも入力してすぐに出力されて、待たされるというイメージはまったくありません。この差を実際に体験すると、Mac StudioでのローカルLLMでさえ、「我慢すれば使える」という印象になってしまいます。特に、大きな入力や出力になった際には、この性能差はより大きく影響します。
コストについて
先ほどの記事の要約で使ったトークンは、全体でおおよそ5000トークン程度です。仮にGemini 3.5 Flash Liteで同等のトークンを処理した場合でも、費用は約0.5円未満に収まります。用途や選択するモデルによっては、さらにコストを抑えられる場合もあります。
もしローカルLLMを導入する目的が「コスト削減」や「日常的なチャット利用」のみである場合、クラウドAIを利用した方が圧倒的に高速で使い勝手が良く、トータル費用も安く済むケースがほとんどです。
さらにクラウド型AIであってもプロンプトキャッシュ機能は自動で適用されるため、継続的なやり取りによる料金割引も期待できます。こうした点まで考慮すると、純粋にコストだけを比較してローカルLLMを選択する合理性は、かなり小さくなります。
最後に
今回の検証結果からわかる通り、現在のハードウェア環境とエンジン対応状況において、すべての社内AIタスクをローカルLLMだけで賄うのは現実的ではありません。
応答速度や精度が要求される対話タスクはクラウドAIを、データ漏洩を避けたい機密処理やバックグラウンド処理はローカルLLMというように、双方の強みを活かした「適材適所のハイブリッド構成」を設計することこそが、実務における最適解となるでしょう。
次回は、このLM Studioをサーバーとして動作させ、他のアプリケーションなどにつないで利用する方法を紹介します。
最終的な目標であるAnythingLLMを使って、LM StudioとOpenAIやGeminiなどのクラウドAIのAPIキーを使ってハイブリッドなAI環境を構築するための前準備という位置付けです。
