MiniMind
基本信息
-
类型:教学性质的大模型从零训练项目(开源)
-
卖点是那句话:2 小时完全从 0 训练一个 26M 参数的小 GPT(对比 GPT-3 的 175B,小了约 6700 倍)
-
开源地址:GitHub
xiguiwang/minimind(多个社区 fork)
说人话版:它是干什么的
- 不是用来做产品的,是用来亲手体验大模型怎么炼成的:普通 GPU 就能跑,把大模型训练的全流程走一遍
训练三步流程
- 预训练(学知识):
python train_pretrain.py→ 输出pretrain_*.pth - 有监督微调(学对话):
python train_full_sft.py→ SFT 权重 - 部署推理:加载权重开始对话
- 数据文件有多种搭配方案,按 GPU 资源自由选择;权重每 100 步自动保存
定位提醒
教学 / 学习工具,对视频制作等工作流没有直接帮助;想搞懂「大模型到底怎么训练出来的」,跑一遍就明白。
版本谱系(2026-10-02 核实,原笔记的 26M 已是两代前)
| 版本 | 规模 | 时间 |
|---|---|---|
| minimind2 系列 | 26M / 145M | 两代前 |
| minimind-3 | 64M | 当前主线 |
| minimind-3-moe | 198M / A64M | 2026-04-01 |
| minimind-3v / 3v-moe | 视觉版 | 2026-04 |
| MiniMind-O | 语音全模态 | 见 arXiv:2605.03937 |
「2 小时训练 26M」这个卖点的方法论仍然成立,只是现在的最小版本是 64M。引用时写清是哪一代。
官方链接
- GitHub:https://github.com/jingyaogong/minimind
- 视觉版:https://jingyaogong.github.io/minimind-v/
- MiniMind-O 论文:https://arxiv.org/pdf/2605.03937
相关日记
- 2026-09-07 - 首次了解
- 2026-10-02 - 核实:补 minimind-3 系列谱系,26M 已是两代前