Red Hatは、9月9日(米国現地時間)、「Red Hat AI 3.5」の一般提供を開始したと発表した。デプロイ前のモデル検証機能「EvalHub」、可観測性ダッシュボード、共有GPU向けのマルチテナント機能、AIエージェントの開発支援機能などを備える。ハイブリッドクラウド環境において、AIワークロードの制御、セキュリティ確保、可観測性を実現する基盤を提供する。
安全性の面では、EvalHubの一般提供により、カスタムモデル、RAG、エージェントに対する安全性および監査可能なコンプライアンスレポートを自動化できる。カタログには、Google(Gemma 4)、NVIDIA(Nemotron 3)、Alibaba Cloud(Qwen)など20以上の検証済みモデルが追加された。これらのモデルには性能ベンチマークに加え、Garakによる安全性、個人識別情報(PII)の漏洩、有害性のリスクスコアが統合されている。
可観測性の面では、推論の健全性、GPU使用率、モデルのパフォーマンスをリアルタイムに確認できるダッシュボードを提供する。あわせて、ユーザーごとのトークン消費量の計測や、MLflowのビジュアルエージェントトレースにも対応した。
マルチテナント環境向けには、テナント間のリソース割り当てを管理するフェアシェアGPUスケジューリングを搭載した。また、アドミッション制御と優先度に基づくリクエストのルーティングを行う、優先度を反映したサービング機能も備える。さらに、ホスト型コントロールプレーンを正式にサポートし、OpenShift Virtualizationの仮想マシン上でのAIワークロード実行によるVMレベルの分離にも対応した。
エージェント開発に関しては、Responses APIと組み込みRAGの一般提供サポートを開始した。統合されたNeMo Guardrailsにより、悪意のあるツール呼び出しを遮断する。ほかにも、pgvector対応のAutoRAG、クエリの複雑さに応じて演算リソースを調整する推論時スケーリング(ITS)を提供する。AI Hubでは、コードレビューや文書処理などに向けたエージェント・テンプレートを用意する。
このほか、CPUオフロードの一般提供、vLLM Omni(早期アクセス版)によるマルチモーダル・サービングを開始した。llm-dの分散推論機能はサードパーティ製Kubernetesサービスへ拡張され、CoreWeave CKSとMicrosoft Azureでは一般提供、Amazon EKSではテクノロジープレビューとして利用できる。Red Hat AI 3.5は、Red Hat AI Factory with NVIDIAの一部としても利用可能である。
この記事は参考になりましたか?
- この記事の著者
-
CodeZine編集部(コードジンヘンシュウブ)
CodeZineは、株式会社翔泳社が運営する開発者のための情報メディアです。日々の開発に取り組むエンジニアやテクノロジーを学びたい方に向けて、プログラミングやAI活用、開発ツール、エンジニアの学びとキャリアに関する記事をお届けしています。
※プロフィールは、執筆時点、または直近の記事の寄稿時点での内容です
この記事は参考になりましたか?
この記事をシェア
