recurring author
Wei Ye
2 archived notes
Related Notes
按论文归档时间排序,展示该作者在本站已经出现的材料。
归档 更新
Scaling Latent Reasoning via Looped Language Models
Ouro 将同一 Transformer 层栈重复执行,并用熵正则化退出分布与冻结主模型后的专门门控训练分配 token 级计算深度;1.4B 和 2.6B 模型经过 7.7T token 训练后在 MATH500、OlympiadBench 等部分推理评测达到 4B 和 8B 对照的结果,但对照没有统一训练数据与总计算,固定四步之外的任务性能通常下降。
待审阅 2510.25741-scaling-latent-reasoning-looped-language-models Reasoning AnalysisScaling LawsTraining Stability
归档 更新
A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions
把 LLM 强化学习中的高成本外部监督与有限内部生成经验统一到 data、training、framework 三层九类干预点,并组织为一份覆盖 125 条文献记录的设计地图。