AWSは7月16日、Amazon EKSで最大10万台のノードをサポートするクラスターの提供を発表した。これにより、最先端のモデルトレーニング、ファインチューニングなどの超大規模人工知能及び機械学習ワークロードが可能になる。
今回の機能強化により、単一のKubernetesクラスターで最大160万個のAWS Trainiumチップまたは80万個のNVIDIA GPU構成を実現。
また、一連のアーキテクチャ改善とさまざまな最適化を行い、Kubernetesに準拠しながら大幅なパフォーマンス向上を達成した。
なお、詳細な設計や検証の過程がAWSのブログで解説されている。
この記事は参考になりましたか?
- この記事の著者
-
CodeZine編集部(コードジンヘンシュウブ)
CodeZineは、株式会社翔泳社が運営する開発者のための情報メディアです。日々の開発に取り組むエンジニアやテクノロジーを学びたい方に向けて、プログラミングやAI活用、開発ツール、エンジニアの学びとキャリアに関する記事をお届けしています。
※プロフィールは、執筆時点、または直近の記事の寄稿時点での内容です
この記事は参考になりましたか?
この記事をシェア
