nanochat

単一GPUノードで自分用の小さなChatGPT型モデルを学習するための、最小限で改造しやすいコードです。事前学習から微調整、評価、推論までを低コストで扱えます。

Xで共有ライセンス: MIT

概要

nanochatは、単一のGPUノードで小規模なChatGPT風の言語モデルを自分で学習するための、最小限で手を入れやすいコードベースです。トークナイズ、事前学習、ファインチューニング、評価、推論までを扱い、完成したモデルとは簡単なCLIで対話できます。トランスフォーマーの層数を表すdepth一つの設定から、他のハイパーパラメータが自動で決まります。READMEでは、GPT-2相当のモデルを8XH100で約2時間、約48ドルで学習できるとされています。

主な特長

  • トークナイズから推論まで一通りを網羅
  • 少ないコードで単一GPUノード上で動作
  • depthの設定一つで他のパラメータを自動決定
  • 学習したモデルとCLIで対話

こんな人・用途に

LLM学習の全工程を低コストで理解し、改造したい学習者や研究者向け。GPT-2スピードランのリーダーボードもあります。

アップストリーム
karpathy/nanochat
GitHubのフォーク
Guo-astro/nanochat
アップストリームのスター数
58k
カテゴリ
AIエージェントとLLMツール
言語
Python
ライセンス
MIT
フォーク日
2025-10-14
同期状態
同期済み最終同期 2026-09-29