行业资讯

OpenCSG 最新研究成果入选 ACL 2026:DoGraph 探索大模型数据混合新范式

发布时间:2026/7/31 21:13:52
OpenCSG 最新研究成果入选 ACL 2026:DoGraph 探索大模型数据混合新范式 从“模型越大越好”到“数据怎么喂更重要”——这句话在大模型圈子里已经流传了一段时间但真正把它做成可落地方法的工作并不多。最近OpenCSG 研究团队发表了一篇论文《Rethinking Data Mixing from the Perspective of Large Language Models》提出了一种新的数据混合框架 DoGraph尝试从模型自身的训练动态出发重新定义“数据该怎么配比”这个问题。一、大模型训练的难题不是数据越多越好而是比例怎么配训练一个大语言模型需要海量文本数据。但这些数据从来不是均匀分布的——互联网上爬取的 web 文本如C4、CommonCrawl动辄上万亿 token而学术论文ArXiv、代码GitHub、专业书籍这类高质量数据则相对稀缺。如果直接按数量比例混合模型会被汹涌的通用网页文本“淹没”专业能力的训练信号反而被稀释。这并不是一个新问题。研究者很早就意识到训练数据的混合比例data mixing strategy对最终模型性能有着决定性影响。GPT-3、LLaMA、Mistral 等知名模型在发布时都会披露自己的数据配方——哪类来源占多少比例——这本身就说明了数据调度的重要性。然而现有的大多数方法都面临一个共同局限它们依赖人类预先定义的数据域domain。比如把数据分成 Wikipedia、书籍、代码、新闻、论文等几个大类然后用各种算法强化学习、损失比较、缩放定律拟合来决定每类数据的权重。这类方法看起来直觉合理但其实隐藏着一个根本性的假设人类定义的“域”就是模型学习时感知到的“域”。二、人类眼中的数据域未必是模型眼中的数据域当我们说“Wikipedia 的数据”和“GitHub 的代码”属于不同的域这是基于人类的分类直觉。但对模型来说它并不是在“读 Wikipedia”或“读代码”——它在做的是根据输入文本计算梯度更新参数。模型真正“感受到”的数据区别是通过梯度方向的差异体现的如果两条数据对模型参数的更新方向非常相似模型就会把它们视为同类反之则视为不同的域。一个非常直观的可视化实验研究者在训练的不同 epoch 下收集了来自不同来源C4、Wikipedia、Book、ArXiv、GitHub 等数据样本的梯度方向并用 PCA主成分分析将高维梯度投影到二维空间观察各类数据的分布。在训练初期不同来源的数据在梯度空间中形成了相当清晰的聚类——Wikipedia是一簇代码是一簇网页文本是一簇。但随着训练持续推进这些聚类开始互相渗透、边界模糊最终在 PCA 投影中彼此重叠。这说明模型对数据域的感知并不是静止的而是随着训练不断重塑的。这个发现意味着什么意味着如果我们在训练一开始就按照固定的人工标签分好域、配好比例然后一路保持不变这个策略实际上是在用第 0 步时的模型感知来指导整个训练过程。而到了训练中后期模型已经发展出截然不同的内部数据结构固定的域划分早已不再贴合实际。这种从模型参数更新角度看数据的方式被称为 gradient geometry / gradient signatures——每一条训练样本在当前模型状态下产生的梯度方向就是这条数据在模型眼中的“身份证”。不同数据的梯度签名越相似它们在模型的“感知世界”里就越接近同一个域。三、DoGraph让模型根据梯度变化动态调整数据权重认识到“模型眼中的域”与“人类标签的域”存在本质差异之后研究团队提出了 DoGraph——一个基于图约束重加权graph-constrained reweighting的数据混合框架。它的核心思路是不再完全依赖固定的人工域标签而是在训练过程中持续从模型自身的梯度信号里识别潜在的域结构并动态调整各域权重。听起来有些抽象我们来拆解它的工作流程。每个训练轮次开始时DoGraph 会对当前批次的每条样本计算梯度然后使用随机投影random projection将极高维度的梯度向量压缩到低维空间——这一步是工程上的关键避免了直接操作亿级参数梯度带来的计算爆炸问题。压缩后的梯度向量会通过 K-means 聚类算法分组形成 m 个模型中心的潜在域model-centric domains。这里的“域”不再是“这条数据来自 Wikipedia”而是“这条数据在当前模型状态下产生的梯度方向与这 m 个簇中的哪一个最接近”。每个域内所有样本的平均梯度反映了这个域对模型参数的综合影响方向和强度。接下来DoGraph 会通过一个优化步骤来求解各域的权重目标是让各域的加权梯度组合能够更稳定地推动模型向更好的方向收敛。实验中对不同优化目标进行了对比最终采用了基于“域内梯度不确定性uncertainty”的目标函数——直觉上如果一个域内的数据梯度方向非常一致低不确定性说明这个域目前对模型来说是“学得比较稳定”的而梯度方向混乱高不确定性的域则需要更谨慎地调度权重以避免引入噪声。**最终根据计算出的各域权重对每条样本的梯度进行加权更新模型参数。**这整套流程会随着训练持续迭代——域的划分和权重会跟随模型的学习状态不断演化而不是在训练开始时就固定下来。在训练后期即便原始人类来源标签已经高度混杂DoGraph 仍能在梯度空间中清晰地抽取出 m11 个潜在域展示出模型内部真实存在的、超越表面来源标签的数据结构。四、从 GPT-2 到 LLaMA更稳定的泛化表现方法再有新意也需要用数据说话。这项工作在多个模型规模和数据集上进行了系统性评估覆盖了从 GPT-2 Small210M到LLaMA-3.2-3B 的不同量级以及 SlimPajama 和 The Pile 两个主流预训练数据集。评估指标涵盖 9 个稳定 benchmarkHellaSwag、PiQA、OpenBookQA、COPA、LogiQA、WinoGrande、SciQ、ARC-Easy 和 Lambada。先看最核心的一组数据。在 GPT-2 Medium300M SlimPajama 的主实验中DoGraph 与六种对比方法的 benchmark 平均分和验证集困惑度Perplexity结果如下DoGraph 以 37.9 分位列第一高于表现次优的 Dynamic Loss-Based37.2 分更明显优于 DoReMi36.5、RegMix35.7和 Uniform35.4。在验证集困惑度PPL越低越好方面DoGraph 的 PPL 为 3.09也是所有对比方法中最低的相比 Uniform4.13下降幅度相当显著。值得注意的是RegMix 和 Data Mixing Law 尽管在部分 benchmark 上表现尚可但在 PPL 上却高达 4.50 以上说明其模型收敛质量存在明显短板。这个优势在更大规模模型上同样稳定。在实验里LLaMA-1.1B The Pile 上 DoGraph 平均分为 42.5LLaMA-3.2-3B The Pile 上达到 43.1在更小的 GPT-2 Small SlimPajama 设置下DoGraph 平均分为36.4。跨越多个模型规模、两个不同的训练数据集DoGraph 都表现出稳定的竞争优势说明这套方法并非只对特定规模或特定数据集“调出来的”具有较好的泛化性。此外消融实验中展示了聚类数目 m 对验证集 PPL 的影响结果呈现 U 型曲线m 太少无法捕捉梯度空间中的真实结构m 太多则会过度切分梯度空间引入冗余噪声。m11是一个相对较好的平衡点。这个结果也侧面说明“模型眼中的域”确实比人工定义的 7 个 SlimPajama 来源类别更细腻但也并非无限可分。计算开销方面展示了在 2 块 NVIDIA H200 GPU 上的运行时间对比。DoGraph 完成预训练总用时 20.37 小时相比 RegMix 仅增加了约 4.51%的额外运行时间——而 RegMix 在性能上远不如 DoGraph。换句话说DoGraph 用较小的计算代价换来了更好的训练质量。五、OpenCSG的价值把数据治理做到模型训练深处OpenCSG在国内 AI 社区中通常以开源平台和语料建设见长。DoGraph的发表展示了 OpenCSG 团队在另一个层面上的投入对大模型底层训练机制的原理性研究。数据怎么配比、配比策略对模型参数更新的影响、如何从训练动态中反向识别数据结构——这些问题不是产品功能迭代能解决的需要真正深入到梯度、优化和训练动力学的层面。OpenCSG的研究思路不是把数据治理停留在“清洗干净、标注准确”的层面而是继续追问什么样的数据在什么样的训练阶段以什么样的比例进入模型能最有效地转化为模型能力这是一个横跨数据工程和训练机制的深度问题。DoGraph正是这种思考方式的落地它把数据调度问题从“人工经验配方”推向“训练动态驱动的自适应调度”为数据混合策略提供了一种更模型中心、更可解释的路径。从平台到研究的延伸也值得关注。OpenCSG 在语料建设、数据质量评估上的长期积累为这类研究提供了天然的实验土壤。当一个团队同时深度参与数据平台建设和训练方法研究他们能在两个方向上互相印证平台侧看到的数据质量问题能反哺训练方法的设计训练侧发现的规律能反过来指导语料建设策略。值得强调的是该方法并不是在宣称“解决了所有数据混合问题”——DoGraph 是在特定实验设置下decoder-only Transformer、预训练阶段验证的实际落地到超大规模训练中还有诸多工程挑战。但作为一种方法论上的推进它有着清晰的意义推动数据治理从经验规则走向训练动态驱动让“高质量数据如何真正转化为模型能力”这个问题有了更系统、更可解释的答案。六、DoGraph 与现有方法一张表看清差异为了更直观地理解 DoGraph 相较于现有方法的不同我们从几个关键维度做一次横向对比。可以看出现有主流方法的核心差异在于是否依赖固定的人工域标签以及是否能感知训练过程中模型状态的变化。Uniform 最简单完全不做域区分DoReMi、DOGE、RegMix 等方法引入了更复杂的优化机制但域划分仍然是静态的、人工预定义的。DoGraph 的核心突破在于把“域是什么”这个问题本身也纳入了训练循环让模型的梯度信号来回答。结语数据调度是大模型竞争的下一个主战场如果说 2023 年大模型竞争的关键词是“规模”2024 年是“推理效率”那么越来越多的迹象表明数据质量、数据调度和训练机制正在成为下一个真正拉开差距的地方。再大的模型如果训练数据配比失当也很难达到潜在的能力上限而精心调度的数据可能让中等规模的模型超越更大的竞争对手。《Rethinking Data Mixing from the Perspective of Large Language Models》这篇论文提供的不仅是一个具体的算法DoGraph更是一种看待数据混合问题的新框架不要只问“这些数据从哪里来”更要问“在当前训练状态下模型如何感知这些数据”。当我们把视角从数据的人类属性转移到数据在模型梯度空间中的动态结构许多原本模糊的问题开始变得可测量、可优化。当然这项工作也有其边界。当前实验集中在预训练阶段的decoder-only 模型DoGraph 在指令微调、强化学习对齐等阶段的效果还有待验证。梯度的计算和存储在超大规模千亿参数级训练中仍是工程挑战。这些也许正是接下来值得继续探索的方向。大模型的下半场数据不再只是“原材料”而是可以被精细调度、动态感知、持续优化的训练信号。OpenCSG 发表这篇论文是把长期积累的数据工程实践推向基础方法研究的一次探索——也是对“高质量数据如何真正转化为模型能力”这个核心命题给出的一份认真的学术回答。论文链接arxiv:2604.07963——Rethinking Data Mixing from the Perspective of Large Language ModelsACL 论文链接aclanthology.org/2026.a行业标杆地位的验证OpenCSG发布的FineWeb-Edu-Chinese作为全球下载量排名前三的中文预训练数据集,累计下载超百万次其价值已经得到业界广泛认可:学术领域被**斯坦福大学、清华大学、中国人民大学高瓴人工智能学院、上海人工智能实验室、北京智源研究院等 20 余家顶尖机构的论文引用。旗下 Chinese Fineweb Edu 已成为中文 NLP 研究的核心数据资源被 100 篇学术论文引用在 NeurIPS、ACL、EMNLP、ICLR 等国际顶会及 Nature 子刊、JMLR 等权威期刊中作为核心实验数据集支撑大模型预训练、指令微调等前沿研究合作机构还包括鹏城实验室、西南电子技术研究所、西班牙国家级超算中心Barcelona Supercomputing Center及 Mozilla Data Collective**等全球顶尖科研单位。产业应用:支撑 Llama3-Chinese、DeepSeek 等知名模型训练并被中国移动、中国联通、英伟达NVIDIA、苹果公司Apple Inc.、OPPO、美团、阿里巴巴、蚂蚁集团、面壁智能ModelBest、Krafton等领军企业采用。Chinese Fineweb Edu 已从实验室走向产业场景为创业公司到头部企业的研发团队提供可靠支撑切实推动中文 NLP 应用从理论落地到生产实践。生态影响:下载数量累计超百万次数据体量达 2.42TB覆盖 9.57 亿条高质量文本已孵化出 10 余个垂直领域微调模型。同时OpenCSG 通过开源打分模型和完整工具链输出数据治理方法论带动行业从“模型参数内卷” 转向 “数据基建完善”显著降低中小开发者与研究机构的入门门槛。开源生态OpenCSG 坚持**“开源即文化”**的理念通过透明、共创、共享的社区文化与全球开发者、工程师和 AI 原生企业共同构建智能体生态。关于OpenCSGOpenCSG是全球领先的开源大模型社区平台致力于打造开放、协同、可持续生态AgenticOps是人工智能领域的一种AI原生方法论由OpenCSG开放传神提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub 提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务具备业界领先的模型资产管理能力支持多角色协同和高效复用。