nanochat

精简易改的代码库,可在单个GPU节点上低成本训练自己的类ChatGPT小模型,涵盖分词、预训练、微调、评估和推理。

分享到 X许可证: MIT

概述

nanochat是一个精简、易于修改的代码库,用于在单个GPU节点上训练自己的小型ChatGPT式语言模型。它覆盖分词、预训练、微调、评估和推理,并可通过简单的命令行与训练好的模型对话。只需设置depth,也就是Transformer的层数,其余超参数就会自动确定。README称,在8XH100节点上约两小时、花费约48美元即可训练出GPT-2水平的模型。

主要特点

  • 覆盖分词、预训练、微调、评估和推理
  • 代码精简,可在单个GPU节点运行
  • 只设一个depth,其他超参数自动推算
  • 通过简单命令行与训练好的模型对话

适用场景

适合想低成本理解并改造完整LLM训练流程的学习者和研究者。项目还维护着GPT-2速通排行榜。

上游仓库
karpathy/nanochat
GitHub 上的 fork
Guo-astro/nanochat
上游 Star 数
58k
分类
AI 智能体与大模型工具
编程语言
Python
许可证
MIT
Fork 时间
2025-10-14
同步状态
已同步上次同步 2026-09-29