7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开

作者:量子位 发布:2026-09-14 20:32 收录:2026-09-14 22:10 2 次阅读 约 3532 字
摘要:几百个Agent参与研发,AI开始造AI
推荐理由:本文涵盖「大模型」、「Qwen」、「Agent」等多个主题,重点关注 大模型。
允中 发自 凹非寺
量子位 | 公众号QbitAI

北京中关村学院7名博士生,用一个暑假,从零训练出了一个7B大模型——ZGCM-1

随后,他们把各阶段训练数据和配方、模型权重、训练代码、中间checkpoint和日志也开放出来,让每一位感兴趣的研究者都可以追溯、复现整个流程。

在多项通用评测中,ZGCM-1与Qwen3-8B等同规模模型表现相近;在部分数学推理和搜索评测中,它也能与Qwen3-235B-A22B、GLM-5.1等更大规模的模型比较。

但比最终分数更让人好奇的是,数据、训练、集群、评测这一整套工程,在大厂通常需要几百人的团队协作完成,七个人怎么做得过来?

他们给自己组建了一支几百个Agent的团队,分头处理数据、跑实验、看日志、做评测,亲手实践「AI4AI」研发范式。

模型训完后,团队还对整个模型研发流程中Agent的实际表现做了一次评级,希望基于本次完整的大模型训练实践,为RSI现状提供真实的工程结论。

至于为什么开始做这件事,还要从一顿火锅说起。

img
ZGCM-1模型能力概览及主要技术路线

看了很多技术报告,还是想自己训一次

七个人最初因为兴趣凑到一起:两人人工智能方向,两人网络方向,另外三人分别来自化学、生物和网安。

平时,他们更多是在现成模型上做微调。技术报告看了不少,许多问题却还是想不明白:数据到底怎么选,训练出了问题怎么查,最后写进报告里的方法,又是经过多少次失败才留下来的?一句“我们进行了数据清洗”,落到实际工程中,究竟意味着多少工作?

吃火锅时,大家聊到了这些困惑,也聊出了一个念头:既然光看报告总有弄不明白的地方,要不要自己从头训练一次?

当时,他们甚至想用一个7B模型去挑战Sonnet这样的模型。参数装不下那么多知识,就让模型多想一会儿,学会搜索、使用工具。

至于能走多远,谁也没有把握。他们想先动手,也把过程留下来,让其他学校里同样好奇的研究者有东西可参考。

老师们半信半疑,还是决定让他们试试,先给了一些算力。

接下来的几天,大家日夜赶着复现已有项目,快速迭代一个小模型。团队较为顺利地把完整流程快速跑通了,也让老师们看到继续投入的可能,团队因此获得了更多资源,饭桌上聊出的想法开始变成每天都要推进的工程。

真正开始7B模型的训练之后,他们才发现还有很多东西没有真正弄懂。有些概念在论文里见过,到了要改代码、解释实验现象的时候,又会卡住。

于是大家就让Agent从基本原理开始调研讲解,讲完再回到代码和实验里验证。原本冷冰冰的知识,开始对应具体的实现,也对应一次训练为什么跑不下去。

七个人忙不过来,就组建几百个Agent的团队

也有觉得干不了的时候,他们把整个工程展开,数据、算法、训练、集群、评测……每一项都能对应大厂里的一个专项团队。

七个人既要推进任务,又要不断补课,各种问题也接踵而至。

数据尤其如此:数万亿token来自不同来源,质量参差不齐,清洗、去重、检查格式、核对分布,做完一轮还要继续检查。

当所有这些环节同时压在七个人身上,工作量便远超他们的承受范围。

于是,他们开始给自己组建一支Agent团队。

几个人调度几百个Agent,逐渐分出了做数据、跑实验和做评测的不同Agent子团队,还搭建了类似论坛的任务发布与汇报系统,让任务有人接、进展有地方看、结果能被检查,也评价不同Agent的工作。

研究者负责提出目标、设定约束和做关键判断,Agent把具体工作持续推进下去。

比如在数据处理上,团队构建的Agent队伍能依据人给出的质量要求编写清洗脚本,检查数据分布是否达标,并根据结果自动调整规则和阈值,形成一个闭环。

在实验环节,它们同样具备从提交任务、监控日志到定位故障、调整配置的完整能力,甚至能主动发现存储与数据传输的瓶颈,优化训练框架的I/O流程,从而提升训练速度。

同时为了优化Agent之间的迭代和沟通效率,团队通过自研的ZGent平台,把会议讨论、研发决策和计划积累成共享上下文,再把验证过的脚本、工作流和debug经验沉淀为可复用的Skill。后来加入的Agent可以接着此前的经验做事。

大家的日常里,也多了把问题讲清楚、把任务组织好,再回来检查结果这几件事。

img
人与Agent共同参与研发,会议决策和实验经验在后续任务中持续复用

后来,大家逐渐意识到,这种借助AI来研发AI的做法,正是最近非常流行的“AI4AI”。

不过,如果追问AI到底已经能独立做多少事情,光凭“帮了很大忙”的印象还不够。

于是,团队将研发过程拆成11类任务,请核心参与者按照L1到L5的自主性框架逐项评级。

差别很明显,实验监控和部署到了L4,人给定目标与约束后,Agent可以独立规划、执行,并根据反馈继续调整;模型架构和学习算法设计仍在L2,更多是帮助实现已有方案、运行预设实验。

至于研究什么、关键设计怎么选,还需要人来主导。

几个人带着几百个Agent,确实能把许多工作做起来,但距离让AI独立承担整个研发过程,还有不少问题要解决。

img
AI研发自主性的五个等级

img
不同研发任务中的AI自主性评级,来自团队9名核心参与者的评分的平均值

loss还在降,模型怎么退步了

有了Agent团队,训练中该踩的坑也没有自动消失。一次训练看起来很正常,loss仍在下降,模型能力却突然出现了明显退步。曲线没有告诉他们出了什么事,只能继续往下查。

最后,问题追到了底层的数据分片和shuffle环节:实际送进训练的数据比例发生了波动,模型吃进去的东西,并不总是他们以为的那份配方。

这次以后,团队不敢再只盯着loss。他们更密集地保存中间checkpoint,追踪知识、数学、代码和推理等能力的变化,还建立了ACE原子能力评测体系,把能力拆成18类、183项,用2503个探针进行检查。

在内部的分布式评测系统中,一轮诊断大约两三分钟。一次修改让哪里变好了,又让哪里退步了,下一步该查数据还是训练方法,都有了更具体的依据。

img
ACE原子能力评测结果,帮助团队定位不同能力的优势与短板。

在反复排查和修正之间,也有特别开心的时刻。训练到一半,他们让模型写了一首歌,它真的写出来了。

用别人的模型生成文字,已经不是什么新鲜事,但看着自己从随机参数开始训练的模型写出一首歌,感觉还是不同。

那天晚上,大家回到最初吃火锅的地方,又吃了一顿火锅庆祝。后面还有很多工作,饭桌上那个没有把握的想法,至少已经有了可以看见的进展。

当时模型写的那首歌:

img
模型写出歌后,大家回到最初吃火锅的地方庆祝

省下的卡,拿来多试几个想法

一路做下来,他们对研究效率的理解也在变化。过去做实验,很容易先想能不能把某个分数再提高一点;真正承担起从零训练的工程,每个想法都要消耗卡时,就必须多问一句:同样的算力,怎样才能获得更好的效果,或者多验证几个假设?

训练快一点,对他们来说,就意味着还有机会再试几个想法。

最初“让小模型多想一会儿”的设想,也遇到了具体的工程问题。

长推理、搜索和多轮工具调用会不断积累上下文,模型既要装得下信息,成本又不能太高。

团队采用局部注意力与全局注意力结合的架构,在训练过程中把上下文从16K逐步扩展到64K、256K。在256K上下文下,这套设计相较全注意力方案带来约3.94倍的吞吐提升,KV Cache占用降至约六分之一。

他们还结合Muon和FP8改善训练效率,并用延迟缩放与TWEO抑制极端激活值,改善低精度训练的稳定性。

整套方案在16K预训练中达到相同loss的效率,相比标准BF16/AdamW基线提高了约4.2倍。省下来的时间和算力,可以继续投入下一轮实验。

img
注意力方案的效率对比;中、右图展示长上下文吞吐与KV Cache占用变化

装得下信息以后,模型还得知道下一步该做什么。搜索后读哪个结果,工具失败后如何恢复,新证据出现后要不要改计划,这类长程任务都需要模型有连续判断的能力。

团队把交互轨迹重新组织成一个个状态与行动,让模型根据当前任务、历史交互和最新反馈学习下一步决策。报告里几句话能写完的方法,到了实验中,往往要拆开验证许多次。

真正把模型从头训一遍后,团队也积累了很多只看论文和技术报告很难获得的实践经验。

SFT阶段,更严格的质量筛选让样本减少约44.9%,整体评测表现反而有所提升,尽管并非每项能力都同步受益;长思维链数据比例过高,又会损害指令遵循;Agent数据也不能脱离通用能力单独训练。

他们开始更在意一个方法在什么条件下有效、需要付出什么代价。最后整理出的多条实战发现,就来自这些被实验反复修正的判断。

img
SFT数据处理流程,覆盖格式规范、质量验证、配比选择和评测去污染。

把模型开源,也把建造记录留下来

等到最后一轮评测跑完,大家才更具体地知道,这个模型走到了哪里。

ZGCM-1在14项推理评测的同规模模型比较中处于领先地位,部分搜索和工具调用任务的结果,也让他们看到了较小模型的潜力。

img
ZGCM-1与同规模模型在14项推理评测中的排名对比

这些问题,也解释了他们为什么想把过程一起开放。最终权重能让人使用模型,各阶段权重、中间checkpoint、训练代码、数据配方和日志,则让其他研究者有机会追踪能力如何形成,检查一个改动究竟带来了什么。

曾经读技术报告时想知道、却看不到的细节,他们想在自己的项目里尽量留下来。

如今,他们已经开始尝试400B、500B规模的模型。

7B阶段积累的方法,到了更大的规模上还能用多少?几百个Agent又能承接住多少新的工作?

这些问题,他们准备继续在实验里找答案,也把新的过程继续记录、分享。

最初那顿火锅上聊出的想法,还在往前走。

ZGCM-1开源链接
ZGCM-1技术报告:https://github.com/zgcagi/ZGCM-1/blob/main/zgcm-1-tech-report.pdf
训练、数据处理等代码:https://github.com/zgcagi/ZGCM-1
模型权重:https://huggingface.co/zgcagi/ZGCM-1-7B
训练数据:https://huggingface.co/datasets/zgcagi/ZGCM-1-Data

作者团队及合作单位
本项目由北京中关村学院与中关村人工智能研究院的何纪言指导,由AI核心学部、软件智能研究所、未来实验室的师生共同完成,核心成员为(按姓氏拼音排序):冯文俊、关浩祥、郭俊毅、梁广、柳浩、沈逸飞、孙锦博、谢彦泰。
此外,项目还得到了中关村两院以下师生的共同参与和支持(按姓氏拼音排序):陈凯、李亚韬、刘铁岩、任宇轩、邵斌、魏楚扬、徐薛胤、张晓庆、赵王宏楦、郑书新、周可心、朱明航、朱文辉。

*本文系量子位获授权刊载,观点仅为原作者所有。


一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  —

🌟 点亮星标 🌟

科技前沿进展每日见

转载声明:本文转载自原发布平台 (作者:量子位), 原文标题《7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开》, 查看原文。 版权归原作者及原发布平台所有,本站仅作收录与展示,未对正文内容作实质性修改; 若涉及侵权请联系本站处理。