tracked author

Peiyi Wang

Math-Shepherd first author and DeepSeek-R1 core contributor. OpenReview records Peking University PhD training under Zhifang Sui; GitHub and Hugging Face use the wangpeiyi9979 / peiyi9979 handle family. X search result self-identifies DeepSeek, MathShepherd and DeepSeekMath work.

3 archived notes X: high GitHubX

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

Jun 23, 2026

DeepSeek V3 Technical Report

DeepSeek V3 用 MLA (Multi head Latent Attention,多头潜变量注意力)、DeepSeekMoE、无辅助损失负载均衡、MTP (Multi Token Prediction,多 token 预测)、FP8 混合精度训练和 DualPipe 通信重叠,把 671B total / 37B active 的开放 MoE (Mixture of Experts,混合专家) 模型训练到强代码、数学和通用...

2412.19437-deepseek-v3-technical-report MoE ArchitectureDistributed TrainingMulti-Token Prediction
Jun 23, 2026

Math Shepherd: Verify and Reinforce LLMs Step by step without Human Annotations

Math Shepherd 的核心价值在于把数学推理步骤的标注问题改写为“当前 step 之后还能否补全到正确答案”的 Monte Carlo potential estimation:对每个中间 step 采样多个 continuation,用最终答案正确性给 step 生成 hard / soft pseudo label,训练 PRM 做 verifier reranking,并进一步把 PRM reward 接入 step b...

2312.08935-math-shepherd-automatic-process-supervision Process SupervisionVerifierReward Modeling
Feb 06, 2026

DeepSeek R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek R1 v2 的核心结论是:大规模 outcome based RL 可以在强 base model 上诱导 long CoT reasoning、自我反思、验证和策略切换等行为;R1 Zero 证明无需 SFT 也能通过 rule based verifiable reward 激发 reasoning capability,R1 则通过 cold start SFT、两阶段 RL、rejection samplin...

2501.12948-deepseek-r1-rl-reasoning Reasoning RLReward ModelingRL Algorithm