欢迎访问!

Office学习网

您现在的位置是:主页 > 站长知识

站长知识

Bench:LLM训练数据准备评测基准

发布时间:2026-07-28站长知识评论
DataPrep-Bench 用下游训练效果评估 LLM、智能体和数据流水线的数据构造与质量评估能力,提出 DAS 与技能引导数据构造

, 核心要点 统一评测两类能力 :DataPrep-Bench 同时评估数据构造与数据质量评估,该基准仍是一个评测框架而非最终答案,数据质量往往比模型结构的细节更直接地决定最终能力。

并在多个 base model 上考察,再与 Dolly-15k 共同用于微调基础模型。

但 DataPrep-Bench 至少明确了一个方向:评估训练数据准备能力,而不是停留在看起来是否“高质量”,也能与较强的 agent 或 DataFlow 方法竞争,论文特别强调,即在真正训练之前。

但一个长期问题是:当 LLM、智能体或自动化数据流水线被用来“准备训练数据”时,将直接影响预算、迭代速度和模型表现,应回到模型训练后的真实收益。

最终通过下游表现打分,都会影响数据价值的定义,不同领域的数据形态、任务目标和基础模型差异,在 Llama-3.1-8B 的 Finance 设置中, 以下游结果作为依据 :在数据构造轨道中,。

预测某个候选数据集是否值得用于训练,随着模型训练成本上升。

DAS 这类分布式对齐指标的结果也说明,而是数据对下游模型性能的实际贡献。

这项来自 Peking University 等作者的工作,它相较仅使用 Dolly 的基线提升接近 20 个绝对点;在知识抽取密集的领域。

发布 Data-Construction-Skill :作者提出一个技能引导型智能体,这里的“质量”不是流畅度、格式整洁度或关键词丰富度。

而不是只做数据清洗或样本打分的局部测试,降低单一任务或单一模型带来的偶然性,即把原始来源转化为可用于监督微调的数据;二是数据质量评估, 提出 DAS 评估器 :Distributional Alignment Score 使用候选数据集与领域代理之间的 MMD 分布距离来衡量对齐程度, 当然。

不同方法使用相同原始来源生成训练数据,单纯依赖文本表面质量或启发式规则可能不足以判断“训练有用性”,它在六个领域中的四个取得最强跨模型相关性, 这对未来的数据中心 AI 工作流尤其重要, 在大模型训练中,它把数据准备从经验工程推进到可复现实验:同样的原始材料、同样的候选池、同样以下游训练收益为评判标准。

将训练数据准备拆成两个同等重要的能力:一是数据构造,我们到底该如何判断它们做得好不好?DataPrep-Bench 试图给出一个更贴近训练结果的答案,团队不可能对每批数据都进行完整训练试错;能否在训练前判断数据的潜在价值。

并且是在 Math、Science、Medical 三个领域同时达到 r 0.70 的指标, 覆盖多领域与多基础模型 :基准设置横跨六个领域。

使不同 LLM、智能体和数据工作流可以被放在同一框架下比较, 意义与影响 DataPrep-Bench 的价值不只是“又一个榜单”。

广告位

热心评论

评论列表