CodeZineを運営する翔泳社より、9月24日(木)に書籍『LLMアプリケーション評価駆動開発 継続的に改善し運用していくための実践知』が発売となりました。
LLMを組み込んだアプリケーションは、出力が確率的で自由度が高く、同じ入力でも結果が変わることがあります。そのため、正解が一つに定まらず、何をもって「いい出力」と判断すればいいのかが難しいだけでなく、プロンプトを修正して一部が改善しても、別の出力がおかしくなることがあります。
LLMアプリケーションの品質に直結するこの重大な課題に向き合うための方法が、本書で紹介する評価駆動開発です。
評価駆動開発では、まずアプリケーションがユーザーに提供すべき価値を定義し、それを評価観点、評価指標、評価基準に落とし込み、その評価結果をもとにプロンプトやコードを改善します。評価結果は改善・変更を判断する材料としてだけでなく、「どこまでできればリリース可能か」をチームで共有するための共通言語にもなります。
本書では、最初に理論編で評価設計の全体像、人手・プログラム・LLMによる評価の使い分け、LLM-as-a-Judge、LLMOpsなどについて解説します。実践編では、問い合わせメールの返信案を生成するアプリケーションを題材に、LangSmithを使った評価データセットの作成、リリース前の評価とチューニング、リリース後のモニタリングまでをひととおり体験できます。
これからLLMアプリケーションやAIエージェントを作る人はもちろん、運用中のサービスを改善したいエンジニアにとって、評価を開発プロセスへ組み込むために不可欠の1冊となりでしょう。
目次
【第1部 理論編】
第1章 なぜLLM アプリケーションを評価する必要があるのか
1.1 評価が必要な理由
1.2 LLMアプリケーション特有の評価の難しさ
1.3 なにを評価すべきかはアプリケーションの目的次第
1.4 評価がチームにもたらすもの
1.5 評価の3つの目的
1.6 評価駆動開発というパラダイムシフト
1.7 技術構成では変わらない評価の本
1.8 AI時代の新たなスタンダードとなる「評価駆動開発」
1.9 本章のまとめ
第2章 LLMアプリケーション評価設計の全体像
2.1 評価設計に必要な要素
2.2 「何のために(why)」評価するのか―評価の目的
2.3 「なにを(What)」評価するのか①―評価対象の設計
2.4 「なにを(What)」評価するのか②―観点・指標・基準の設計
2.5 本章のまとめ
第3章 LLMアプリケーション評価の実行プロセスと運用設計
3.1 「誰が(Who)」評価するのか―評価者の設計
3.2 「どのように(How)」評価するのか―評価データセットと評価方法の設計
3.3 「いつ(When)」評価するのか―評価タイミングの設計
3.4 「どこで(Where)」評価するのか―評価環境の設計
3.5 評価のゴールを定める―合格基準の設計
3.6 アプリケーションのライフサイクルと評価戦略の進化
3.7 本章のまとめ
第4章 評価設計の進め方
4.1 LLMそのものとLLMアプリケーションの評価の違い
4.2 LLMそのものの評価をどう参照するか
4.3 LLMアプリケーションの評価
4.4 LLMアプリケーションの出力品質の評価
4.5 レイヤー1の出力品質を超えた評価
4.6 本章のまとめ
第5章 LLM-as-a-Judge
5.1 なぜLLM-as-a-Judgeを使うのか
5.2 LLM-as-a-Judgeの使い方
5.3 LLM-as-a-Judge使用上の注意点
5.4 評価の精度向上
5.5 本章のまとめ
第6章 LLMOpsによる継続的な改善
6.1 LLMOpsとは
6.2 LLMOpsの全体像:継続的改善サイクルという考え方
6.3 LLMOpsサイクルを支える実践基盤
6.4 LLMOpsを効率化するためのツールとサービス活用
6.5 改善手法の選択肢を広げる
6.6 本章のまとめ
【第2部 実践編】
第7章 テーマ設定とサンプルアプリケーションの準備
7.1 第2部のハンズオンの概要
7.2 テーマ設定
7.3 LangSmithのセットアップ
7.4 サンプルアプリケーションのセットアップと起動
7.5 LLMを使ったワークフロー処理の実装
7.6 本章のまとめ
第8章 評価の初期設計と評価データセットの作成
8.1 評価の初期設計
8.2 評価データセットの作成準備
8.3 合成データセットの生成とブラッシュアップ
8.4 評価データセットの保存
8.5 本章のまとめ
第9章 リリース前の評価とチューニング
9.1 リリース前の評価の実装
9.2 人手での評価
9.3 評価指標の改善
9.4 評価結果に基づくチューニング
9.5 本章のまとめ
第10章 リリース後の評価とモニタリング
10.1 リリース後の評価の実装
10.2 リリース後の評価を試す
10.3 リリース後の評価のモニタリング
10.4 本章のまとめ
10.5 第2部のおわりに
付録 LLMそのものの評価
この記事は参考になりましたか?
既に会員の方はを行ってください。
- 翔泳社 新刊紹介連載記事一覧
-
- 正解が1つでないLLMの出力を評価・改善する開発手法を解説 『LLMアプリケーション評価駆...
- ブラックボックス化したWeb APIを理解して使いこなすための『絵で見てわかるWeb AP...
- 苦しみながら会得した経験知の集大成『LLM・AIエージェントシステムベストプラクティス』発...
- この記事の著者
-
【AD】本記事の内容は記事掲載開始時点のものです 企画・制作 株式会社翔泳社
この記事は参考になりましたか?
この記事をシェア

