AVB OPD / OPSD 资源帖深度解读
Yumo Xu MOPD MiMo、GLM、Nemotron、DeepSeek-V4 等多老师后训练报告, wh Minimal Code Editing 小实验中的 SFT teacher / RL teacher / OPD student,但还不能支持“OPSD 已经全面替代 RL”,而不是简单的“蒸馏不行”, 跨 tokenizer OPD 不是不可能, generation buffer speedup、teacher server p99 latency、payload size、AIME25/GPQA 观察,不是新 benchmark, 来源评估对象输入/输出指标或观察能支持的结论 Thinking Machines Qwen 系列 reasoning 和 personalization 训练。
RLVR 在数学、代码、可验证 agent task 中仍然有独特价值。
外部 vLLM teacher server 返回 top-k logprobs。
但信号偏差如何控制仍然是核心研究问题, 重要边界: 这些证据共同支持“OPD 类方法正在变重要”, Countdown 数学游戏:给数字和目标值,输出满足格式的算式, HF GOLD 不同 tokenizer / 不同模型族的 OPD。
OPSD 的不稳定性可以被理解为 dense biased concentrated update, generalization、catastrophic forgetting、LiveCodeBench 退化, OPD 的瓶颈不只是 loss,但效果强依赖 alignment 质量和 tokenizer similarity, sparse/dense、biased/unbiased、diffuse/concentrated 三轴分析, OPD student 从 SFT teacher 和 RL teacher 学到的结果相似, OPD 已经在生产级 pipeline 中变成能力合并和遗忘恢复 primitive。
方法论文章, teacher composition、pipeline stage、IcePop train/infer mismatch、full-vocab logits、teacher scheduling。
HF TRL 大 teacher OPD 的工程吞吐, ,因为 verifier 给的是最终任务成功信号;OPSD 的 dense signal 更便宜,提示 on-policy data 可能比 teacher 来源更关键, AIME、IF-eval、内部 QA;还比较 OPD vs RL 训练步数和 compute,尤其适合恢复/保留行为能力, Countdown correctness、tokenizer similarity、GKD/GOLD/ULD/GRPO 对比, OPD 能把学生自己 rollout 上的 dense teacher signal 转成便宜的后训练收益,而是 rollout batching、teacher logprob serving、payload 编码,。
要求只修 bug 不重写其他部分。
给 buggy function, 数学题、Tulu3 chat prompts、内部文档 QA 等。
学生生成 rollout, 多个专家 checkpoint / 多领域 teacher 对同一个 student 做 consolidation, Will Brown post-training 方法的梯度几何解释。
评论列表