AIGFS

AI・HPC時代のための分散並列ファイルシステム研究データ、学習データ、
シミュレーション結果を安全かつ高速に管理。

AIGFS 概要

AIGFSは、AI時代のデータ処理に対応するオープンソースの分散ファイルシステムです。各種システムで利用しやすい標準仕様をベースに、データセット単位でのオペレーションを可能にし、高速かつPOSIX互換のストレージ基盤として最適化されています。

データセット単位での登録・公開・複製・世代管理・可視化を実現し、クラウド、オンプレミス、リモート環境など、さまざまな環境から効率的にデータへアクセスできます。

基盤となるOSには、広く利用されているDebianベースの環境を採用し、Debian 12以上を使用します。

AIGFSでは、データの利用目的やアクセス頻度に応じてデータを配置できるよう、複数のストレージレイヤーを構成します。メモリデバイスを主体とするRAM Tier、NVMe SSDを主体とする高速なFAST Tierを新たに設け、これらに加えて、データの主たる保存先となるMASTER Tierと、長期保存を担うARCHIVE Tierを構成します。

FAST Tierは、従来キャッシュサーバーとして構成されていた高速アクセスの仕組みを、データセット単位で利用・管理できるストレージレイヤーとして発展させたものです。データの処理内容やアクセス状況に応じて、MASTER Tier上のdatasetをFAST TierやRAM TierへPromoteすることで、高速なデータアクセスを実現します。

ユーザーは元となるデータをMASTER Tierに集約し、一つのdatasetとして登録します。データの更新が行われた場合には、バージョン管理によって各世代を保持することができます。また、長期間アクセスされていないデータセットは、ARCHIVE Tierやリモート先のデータストレージへReplicateし、保存先を移行することが可能です。

このようにAIGFSは、単なるディレクトリの集合体としてデータを管理するのではなく、データの利用目的やアクセス頻度に応じて最適なストレージレイヤーへ配置する、データセット指向のストレージ基盤です。データセットを中心とした管理と、複数のストレージレイヤーによるデータライフサイクル管理を組み合わせることで、AI学習、HPC、研究データ管理など、大規模データを扱う環境に適した性能と運用性を提供します。

AIGFSの基盤となるZFSストレージアーキテクチャーについては「ZFS File System Architecture」を、AIGFSの特徴やストレージ階層、データセット管理機能については「AIGFS Technology Overview」をご参照ください。

AIGFS Tier Architecture

RAM Tier
  • Storage
    Memory Storage(超高速・揮発)
  • 用途
    一時処理 / キャッシュ / 中間生成物
  • 特徴
    最速・揮発性・再生成前提
  • 利用例
    前処理データ・AI Batch作業領域
FAST Tier
  • Storage
    NVMe Storage(高速・主要処理)
  • 用途
    アクティブデータ
  • 特徴
    NVMe・高IOPS・低レイテンシ
  • 利用例
    学習データ・推論データ
MASTER Tier
  • Storage
    HDD / ZFS(正本・信頼性)
  • 用途
    正本データ管理
  • 特徴
    ZFS・高信頼性・スナップショット
  • 利用例
    Dataset本体
ARCHIVE Tier
  • Storage
    大容量・低速(長期保存)
  • 用途
    長期保管
  • 特徴
    低コスト・大容量・低頻度アクセス向け
  • 利用例
    過去データ・法令保存データ

特徴

従来のディスクドライブの扱いを見直すことで、ネットワーク帯域を最大限に活用できる高速ストレージシステムを実現します。

RAM Diskなどは、従来のファイルシステムを介することで高速なアクセス性能を維持することが難しく、RAW Diskとしてデータベースに利用されるケースが中心でした。AIGFSではメタデータを分離することで、データ処理を分散化し、デバイス本来の性能を活かした高速アクセスを実現します。

この効果は特にRAM TierとFAST Tierで顕著に現れ、デバイス構成によっては100MB/秒に迫るI/O性能を発揮することも可能です。
 ※RDMA / RoCEv2やNVIDIA® GDSなどの対応環境が必要です。

AIGFSでは、ディスク1台を単位としてそれぞれが分散処理を実行するため、ディスクを追加することでネットワーク帯域の限界まで性能をスケールアップできます。また、ディスク(ノード)を増設することで、ダウンタイムを発生させることなくスケールアウトする構成も可能です。

データの冗長性が求められる下層のストレージレイヤーでは、堅牢なファイルシステムであるZFSがデータ保持の基盤を担います。ZFSの高いデータ耐久性と信頼性を活かし、エンドツーエンドの整合性検証、暗号化、オブジェクトロック、バージョン管理、監視、データ修復などの機能を組み合わせることで、アクティブデータからコールドデータまで、長期間にわたるデータ保持を支えます。

特に重要なのが、ディスク障害発生時のデータ復旧です。ZFSでは、ディスク単体の容量が数十TBに達する大容量構成においても、必要なデータのみを対象として効率的に復旧処理を行うことができます。従来のRAID ARRAYと比較して、復旧に要する時間を大幅に短縮できる点は、大容量データを長期間保存する環境において大きなメリットとなります。

高速な分散処理とスケーラビリティを担うAIGFSと、データの整合性・耐久性を支えるZFSを組み合わせることで、AI / HPC環境に求められる高速性と信頼性を両立したストレージ基盤を実現します。

Dataset Management Platform

AIGFSはデータセットを中心とした管理基盤です。 Dataset Registryを通じて、データの登録、公開、複製、Tier制御、世代管理を実行できます。 以下は現在実装されている主な機能とコマンド体系です。

機能

  • Datasetの作成・登録
  • Version固定(Immutable管理)
  • 公開 / 非公開設定
  • FAST Tierへの昇格
  • 別拠点・別クラスタへのレプリケーション
  • メタデータ管理
  • 利用者権限管理
  • ジョブ進行状況の表示
  • 監査ログ管理

実例

/mnt/aigfs/tiers
 ┗┳/mnt/aigfs/tiers/master/current
  ┃/mnt/aigfs/tiers/master/versions/v1
  ┗/mnt/aigfs/tiers/master/versions/v2

$ dataset register case001 --version v1 --tier MASTER

$ ls -la /mnt/aigfs/tiers/master/case001/versions/v1
drwx------ 4 admin admin 4096 Mar 1 2026 case001

$ dataset info case001 --version v1
Dataset: case001
Version: v1
Location:
 Master: /mnt/aigfs/tiers/master/case001/versions/v1
Tier: MASTER
Size: 24.3 TB
Files: 183,223,991
Checksum: sha256:abcd..
Created: 2026-03-01
Last Access: 2026-03-23

Replicas:
 storage1 : /mnt/aigfs/tiers/fast/case001/versions/v1
 storage2 : /replica/aigfs/case001/v1

State:
 Published: yes
 Promoted: yes

コマンド一覧

登録・管理

  • dataset registerDatasetをRegistryへ登録
  • dataset list登録済Dataset一覧表示
  • dataset infoDataset詳細情報表示

Tier・Replication

  • dataset promoteMaster Tier→Fast Tierへ昇格
  • dataset demoteFast Tier→Archive Tierへ降格
  • dataset replicate他ノードへ複製
  • dataset archiveArchive Tierへ移動

保全・Version

  • dataset freezeReadOnly化
    ※主にデジタルフォレンジック用途
  • dataset size容量・ファイル数確認
  • dataset tier現在所属Tier確認
  • dataset last-access最終アクセス日時確認
  • dataset versionVersion管理

今後のアップデート

  • dataset last-access最終ACL情報
  • dataset checksumデータ照合
  • dataset verify整合性確認
  • dataset version createVersion作成
  • dataset version listVersion一覧表示
  • dataset version rollback過去Versionへ復元

導入設計

AI/HPC市場では、ファイルをデータセット単位で管理・運用することが前提となりつつあり、その市場規模も拡大を続けています。一方、オンプレミス環境では依然としてファイル単位やユーザー単位での運用が一般的であるため、AIGFSではデータセット管理機能を利用しない従来型の運用モデルにも対応しています。

AIGFSは、CUDAを中心としたAIワークロードを利用するユーザーに対して、RDMA/RoCEv2およびNVIDIA® GPUDirect Storage(GDS)の導入を積極的に推奨しています。一方で、100Gbps〜200Gbpsクラスの環境では、高速ネットワークを活用しながらもユーザー要件に応じた最適な構成を提供します。

また、AIGFSはストレージサーバーだけでなく、クライアントを含めたシステム全体の設計およびカスタマイズを前提としています。運用方法やワークロードに応じて、最適なネットワーク構成、ストレージ階層、データ管理方式を選択できます。

100Gbps帯域のネットワーク環境であっても、シーケンシャルアクセスでは5~8GB/秒程度のI/O性能を実現可能です。ネットワーク上のパケット制御や通信最適化を考慮した設計により、ベンダーロックされた高価な専用ストレージ製品と同等の性能を、より柔軟でコスト効率の高い構成で実現します。

なお、この性能を実現するために、高価なInfiniBand環境やDPU機器の導入を必須としているわけではありません。ユーザーの要件と予算に応じて、最適な構成を選択することが可能です。

ハードウェア構成例

AIGFSは、研究データ基盤からAI学習環境、大規模アーカイブまで、用途に応じて柔軟な構成を選択できます。以下は代表的な構成例であり、必要な性能、容量、可用性、予算に応じてCPU、メモリ、ストレージ、ネットワークを最適化することが可能です。

構成例

導入モデル

オンプレミスAIGFSモデル

研究室・部門向け
50TB〜500TB

標準AIGFS 推奨モデル

推奨構成
500TB〜2PB

大規模AIGFS 2PB超モデル

2PB超〜数十PB