7 篇笔记 · 已建档 Wenfeng Liang (梁文锋) DeepSeek AI / High-Flyer
DeepSeekfoundation models
6 篇笔记 · 已建档 Damai Dai DeepSeek AI / Peking University
DeepSeekMoEDeepSeek-V3
5 篇笔记 · 已建档 Bo Zheng Qwen Team / Alibaba Group
Qwenlarge language models
5 篇笔记 · 已建档 Runxin Xu (许润昕) DeepSeek AI / Peking University
DeepSeek-R1DeepSeek-V3
5 篇笔记 · 已建档 Xingkai Yu (俞星凯) DeepSeek AI / Nanjing University
DeepSeek-R1DeepSeekMoE
5 篇笔记 · 已建档 Yu Wu (吴俣) DeepSeek AI / Microsoft Research Asia
DeepSeek-R1GRPO
4 篇笔记 · 已建档 Haibin Lin ByteDance Seed
VERLHybridFlow
4 篇笔记 · 已建档 Wangding Zeng DeepSeek AI / Beijing University of Posts and Telecommunications
MLADeepSeek-V2
4 篇笔记 · 已建档 Weiran He Moonshot AI / MADSys Lab
LLM servingKVCache
4 篇笔记 · 已建档 Weixiao Huang Moonshot AI / Tsinghua University
cloud-native systemsAI infrastructure
4 篇笔记 · 已建档 Xinran Xu (许欣然) Moonshot AI
Moonshot AIKimi
4 篇笔记 · 已建档 Yuxuan Tong (童雨轩) Tsinghua University / ByteDance Seed
verlDAPO
3 篇笔记 · 已建档 Binyuan Hui Qwen Team / Alibaba Group
QwenQwen-Coder
3 篇笔记 · 已建档 Chi Zhang ByteDance / University of Southern California
VERLHybridFlow
3 篇笔记 · 已建档 Dayiheng Liu (刘大一恒) Qwen Team / Alibaba Group
Qwenlarge language models
3 篇笔记 · 已建档 Deli Chen (陈德里) DeepSeek AI / Peking University
DeepSeek seriesreasoning RL
3 篇笔记 · 已建档 Fan Zhou Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen3
3 篇笔记 · 已建档 Ge Zhang M-A-P / ByteDance Seed
natural language processingmultimodal intelligence
3 篇笔记 · 已建档 Guangming Sheng The University of Hong Kong / ByteDance Seed
VERLHybridFlow
3 篇笔记 · 已建档 Jian Hu NVIDIA / National Taiwan University
ProRLBroRL
3 篇笔记 · 已建档 Jianwei Zhang Qwen Team / Alibaba Group
Qwenlarge language models
3 篇笔记 · 已建档 Jie Tang (唐杰) Tsinghua University / Knowledge Engineering Group (KEG)
large language modelsagentic reinforcement learning
3 篇笔记 · 已建档 Junyang Lin Qwen Team / Alibaba Group
Qwenlarge language models
3 篇笔记 · 已建档 Ning Ding (丁宁) Tsinghua University / Shanghai AI Laboratory
reasoning intelligencescalable reinforcement learning
3 篇笔记 · 已建档 Peiyi Wang DeepSeek AI / Peking University
Math-ShepherdDeepSeekMath
3 篇笔记 · 已建档 Rui Men Qwen Team / Alibaba Group
Qwenpretraining
3 篇笔记 · 已建档 Wang Zhang ByteDance
VERLHybridFlow
3 篇笔记 · 已建档 Xin Cheng Peking University / DeepSeek AI
EngramDSpark
3 篇笔记 · 已建档 Xin Liu ByteDance Seed / ByteDance
LaminarDAPO
3 篇笔记 · 已建档 Yanghua Peng ByteDance Seed / ByteDance
Seed InfraMegaScale
3 篇笔记 · 已建档 Yulun Du Moonshot AI / Carnegie Mellon University
Kimi K2Kimi K2.5
3 篇笔记 · 已建档 Zhenda Xie (解振达) DeepSeek AI / Tsinghua University
foundation modelspretraining
3 篇笔记 · 已建档 Zhifang Sui Peking University
natural language processingcomputational linguistics
3 篇笔记 · 已建档 Zhihong Shao (邵智宏) DeepSeek AI / Tsinghua University
DeepSeekMathDeepSeek-R1
3 篇笔记 · 已建档 Ziniu Li (李子牛) Tencent Hunyuan / The Chinese University of Hong Kong, Shenzhen
large language modelsreinforcement learning
2 篇笔记 · 已建档 Aditi Raghunathan Carnegie Mellon University / AI Reliability at CMU
AI safetyrobust machine learning
2 篇笔记 · 已建档 An Yang Qwen Team / Alibaba Group
Qwenlarge language models
2 篇笔记 · 已建档 Baoxiang Wang (王宝祥) The Chinese University of Hong Kong, Shenzhen / Vector Institute
reinforcement learninggame theory
2 篇笔记 · 已建档 Bo Pang Moonshot AI
Moonshot AIKimi
2 篇笔记 · 已建档 Bowen Baker OpenAI / MIT
multi-agent reinforcement learningchain-of-thought monitoring
2 篇笔记 · 已建档 Bowen Yu (郁博文) Qwen Team / Alibaba Group
Qwenpost-training
2 篇笔记 · 已建档 Bowen Zhou Tsinghua University / Shanghai AI Laboratory
reasoning intelligencenatural language processing
2 篇笔记 · 已建档 Chao Jin Peking University / Key Laboratory of High Confidence Software Technologies, Peking University
MegaScale-MoEUltraEP
2 篇笔记 · 已建档 Chelsea Finn Stanford University / Physical Intelligence
SPIRALLLM-as-a-Verifier
2 篇笔记 · 已建档 Chuan Wu The University of Hong Kong / University of Toronto
LaminarHybridFlow
2 篇笔记 · 已建档 Dongyan Zhao (赵东岩) Peking University / Wangxuan Institute of Computer Technology
natural language processingsemantic data management
2 篇笔记 · 已建档 Fei Huang Qwen Team / Alibaba Group
QwenTongyi Lab
2 篇笔记 · 已建档 Fuli Luo (罗福莉) Xiaomi LLM Core / Xiaomi MiMo
MOPDMiMo
2 篇笔记 · 已建档 Furu Wei (韦福如) Microsoft Research / Microsoft Research Asia
LLM-in-SandboxReOPD
2 篇笔记 · 已建档 Ganqu Cui Shanghai AI Laboratory / Tsinghua University / THUNLP
RLVRLLM alignment
2 篇笔记 · 已建档 Haitao Mi Tencent / Tencent HY Team
FlashMemoryDeepSeek-V4
2 篇笔记 · 已建档 Huazuo Gao DeepSeek AI
DeepSeek-V2MLA
2 篇笔记 · 已建档 Huishuai Zhang Peking University / Microsoft Research Asia
large language modelsoptimization
2 篇笔记 · 已建档 Idan Shenfeld Massachusetts Institute of Technology / Improbable AI Lab
continual learningself-distillation
2 篇笔记 · 已建档 Jan Kautz NVIDIA
NVIDIA Researchmachine learning
2 篇笔记 · 已建档 Ji-Rong Wen Gaoling School of Artificial Intelligence, Renmin University of China
LLM-in-Sandboxlong-horizon agents
2 篇笔记 · 已建档 Jiacai Liu (刘佳材) Fudan University
reinforcement learningLLM post-training
2 篇笔记 · 已建档 Jiamang Wang Alibaba Group
machine learning infrastructuredistributed systems
2 篇笔记 · 已建档 Jianxin Yang Qwen Team / Alibaba Group
Qwenlarge language models
2 篇笔记 · 已建档 Jiashi Li DeepSeek AI / Peking University
DSparkDeepSeekMoE
2 篇笔记 · 已建档 Jiawei Xu The Chinese University of Hong Kong, Shenzhen
reinforcement learningLLM reinforcement learning
2 篇笔记 · 已建档 Jingren Zhou Alibaba Group / Alibaba Cloud
QwenAlibaba Cloud
2 篇笔记 · 已建档 John Schulman Thinking Machines / Anthropic (former)
PPOTRPO
2 篇笔记 · 已建档 Jonas Hübotter ETH Zürich / Stanford University
self-distillationtest-time training
2 篇笔记 · 已建档 Ju Huang Alibaba Group
ROLLasynchronous RL
2 篇笔记 · 已建档 Lei Bai (白磊) Shanghai Artificial Intelligence Laboratory / Fudan University
AI for scienceautonomous scientific discovery
2 篇笔记 · 已建档 Lei Li The University of Hong Kong / Peking University
multimodal LLMsin-context learning
2 篇笔记 · 已建档 Lei Zhu (祝磊) Tencent HY Team / Tencent Hunyuan Frontier Lab
HiLS-Attentionnative sparse attention
2 篇笔记 · 已建档 Li Dong (董力) Microsoft Research / Microsoft Research Asia
LLM-in-SandboxReOPD
2 篇笔记 · 已建档 Lifan Yuan (袁立凡) University of Illinois Urbana-Champaign / Tsinghua University / THUNLP
RLVRPRIME-RL
2 篇笔记 · 已建档 Mingjie Liu NVIDIA / University of Texas at Austin
ProRLBroRL
2 篇笔记 · 已建档 Qian Liu (刘乾) TikTok AI Innovation Center / xAI
natural language processingcode intelligence
2 篇笔记 · 已建档 Ruoyu Qin (秦若愚) Moonshot AI / Tsinghua University
LLM servingsynchronous RL rollout
2 篇笔记 · 已建档 Samyam Rajbhandari Snowflake AI Research / Microsoft (DeepSpeed / ZeRO papers)
DeepSpeedZeRO
2 篇笔记 · 已建档 Shaopan Xiong Alibaba Group
RollArtRollPacker
2 篇笔记 · 已建档 Shen Yan ByteDance Seed / ByteDance
Dynamic Linear Attentionmultimodal pretraining
2 篇笔记 · 已建档 Shizhe Diao Thinking Machines Lab / NVIDIA Research
ProRLBroRL
2 篇笔记 · 已建档 Siran Yang Alibaba Group
AI infrastructuredistributed training
2 篇笔记 · 已建档 Tian Liang Tencent / Tencent HY Team
FlashMemoryDeepSeek-V4
2 篇笔记 · 已建档 Tianle Cai (蔡天乐) Princeton University / Together AI
systems and architecture co-designlarge language models
2 篇笔记 · 已建档 Tri Dao Princeton University / Together AI
FlashAttentionFlashAttention-2
2 篇笔记 · 已建档 Weixun Wang Alibaba Group
RollArtRollPacker
2 篇笔记 · 已建档 Wenbo Su Alibaba Group
RL post-traininglarge language models
2 篇笔记 · 已建档 Xiang Hu Tencent / Tencent HY Team
FlashMemoryDeepSeek-V4
2 篇笔记 · 已建档 Xiang Li ByteDance Seed / ByteDance
LaminarMegaScale
2 篇笔记 · 已建档 Xibin Wu ByteDance / ByteDance Seed
LaminarHybridFlow
2 篇笔记 · 已建档 Ximing Lu NVIDIA Research / University of Washington
ProRLBroRL
2 篇笔记 · 已建档 Yan Wang (王琰) Independent Researchers / Tencent
FlashMemoryDeepSeek-V4
2 篇笔记 · 已建档 Yang Xu (徐旸) MiniMax / Zhejiang University
MiniMax Sparse AttentionMiniMax-M3
2 篇笔记 · 已建档 Yangkun Zhang Moonshot AI
Moonshot AIKimi
2 篇笔记 · 已建档 Yejin Choi Stanford University / NVIDIA
language modelsreasoning
2 篇笔记 · 已建档 Yi Dong NVIDIA
NVIDIA Researchreasoning models
2 篇笔记 · 已建档 Yifan Bai Kimi Team / Moonshot AI
Kimi K2Kimi K2.5
2 篇笔记 · 已建档 Yikai Zhao (赵一开) Moonshot AI / Tsinghua University
LLM servingdisaggregated systems
2 篇笔记 · 已建档 Yingru Li (李英儒) xAI / The Chinese University of Hong Kong
LLM reinforcement learningrollout correction
2 篇笔记 · 已建档 Yuchen Zhang Peking University / Shanghai AI Laboratory
RLVRreasoning models
2 篇笔记 · 已建档 Yujiang Li Tsinghua University / Knowledge Engineering Group (KEG)
agentic reinforcement learningLLM post-training
2 篇笔记 · 已建档 Yushi Bai (白雨石) Tencent HY Team / Tsinghua University
HiLS-AttentionIndexCache
2 篇笔记 · 已建档 Yuxiao Dong Tsinghua University / Knowledge Engineering Group (KEG)
large language modelsagentic reinforcement learning
2 篇笔记 · 已建档 Yuxiong He Snowflake AI Research / Microsoft (DeepSpeed / ZeRO papers)
DeepSpeedZeRO
2 篇笔记 · 已建档 Zhenyu Hou Tsinghua University / Knowledge Engineering Group (KEG)
agentic reinforcement learningLLM post-training
1 篇笔记 · 已建档 Akshay V. Jagadeesh OpenAI / Stanford University
AI alignmentbeneficial AI
1 篇笔记 · 已建档 Akshayaa Magesh Meta AI / University of Illinois Urbana-Champaign
reinforcement learningrobust machine learning
1 篇笔记 · 已建档 Alexander Rakhlin Massachusetts Institute of Technology / University of Pennsylvania
reinforcement learning theoryonline learning
1 篇笔记 · 已建档 Amey Agrawal Georgia Institute of Technology / Microsoft Research India (Sarathi internship)
LLM servingSystems for AI
1 篇笔记 · 已建档 Andrea Zanette Carnegie Mellon University / UC Berkeley
maximum likelihood reinforcement learningfoundation models
1 篇笔记 · 已建档 Ankur Samanta Columbia University / Meta AI
LLM reasoningRLVR
1 篇笔记 · 已建档 Aohan Zeng Z.ai / Tsinghua University
IndexCacheGLM-5
1 篇笔记 · 已建档 Aoqi Hu Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Aosong Feng Yale University / AWS Bedrock
agentic AIlong-horizon human-AI interaction
1 篇笔记 · 已建档 Aritra Mazumder University of Utah / Shahjalal University of Science and Technology
data managementintelligent data systems
1 篇笔记 · 已建档 Ashish Panwar Microsoft Research India / Indian Institute of Science (PhD)
LLM servingsystems
1 篇笔记 · 已建档 Atri Rudra University at Buffalo, SUNY
theoryalgorithms
1 篇笔记 · 已建档 Ayush Jain Meta AI / Meta Applied Reinforcement Learning
reinforcement learningLLM reasoning
1 篇笔记 · 已建档 Azalia Mirhoseini Stanford University / Ricursive Intelligence
LLM-as-a-Verifierself-improving AI
1 篇笔记 · 已建档 Baohao Liao Microsoft Research / University of Amsterdam
ReOPDLLM efficiency
1 篇笔记 · 已建档 Baolin Peng Microsoft Research
large language model agentscomplex reasoning
1 篇笔记 · 已建档 Beidi Chen Carnegie Mellon University / Amazon Scholar
ThunderAgentagentic inference
1 篇笔记 · 已建档 Bhargav S. Gulavani Microsoft Research India / Microsoft
LLM servingsystems
1 篇笔记 · 已建档 Bhavana Dalvi Mishra Google / Allen Institute for AI
self-evolving agentsinteractive reasoning
1 篇笔记 · 已建档 Binbin Zheng Baidu Inc. / University of Science and Technology of China
ECHOagentic RL
1 篇笔记 · 已建档 Bo Zhang (张铂) Shanghai Artificial Intelligence Laboratory
general AI agentsmultimodal reasoning
1 篇笔记 · 已建档 Borui Wan The University of Hong Kong / ByteDance Seed
LaminarByteCheckpoint
1 篇笔记 · 已建档 Chang Chen University of California, San Diego / PICASSO Lab
machine learning systemsdistributed training
1 篇笔记 · 已建档 Chaobo Jia (贾超博) The Chinese University of Hong Kong / ByteDance Seed
Laminarasynchronous RL
1 篇笔记 · 已建档 Che Jiang Tsinghua University / Horizon Research
self-improving agentsagent harness
1 篇笔记 · 已建档 Chen Henry Wu Carnegie Mellon University / Tsinghua University (undergraduate)
language agentsverification
1 篇笔记 · 已建档 Chen Xu Carnegie Mellon University / Renmin University of China
information retrievalfairness in recommender systems
1 篇笔记 · 已建档 Chenchen Zhang Independent Researcher
LLM reinforcement learningcredit assignment
1 篇笔记 · 已建档 Chenfeng Xu Together AI / The University of Texas at Austin
ThunderAgentefficient generative AI
1 篇笔记 · 已建档 Cheng Qian University of Illinois Urbana-Champaign / Tsinghua University
tool-calling RLlanguage agents
1 篇笔记 · 已建档 Chenghao Zhang Gaoling School of Artificial Intelligence, Renmin University of China
long-horizon agentsretrieval-augmented generation
1 篇笔记 · 已建档 Chenze Shao DeepSeek AI / Tencent WeChat AI
DSparkspeculative decoding
1 篇笔记 · 已建档 Christof Monz University of Amsterdam
ReOPDnatural language processing
1 篇笔记 · 已建档 Christopher Ré Stanford University / Hazy Research
Hazy Researchdata-centric AI
1 篇笔记 · 已建档 Chuanyang Jin Johns Hopkins University / Social Cognitive AI Lab
social cognitive AITheory of Mind
1 篇笔记 · 已建档 Chunyang Li Tencent
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Daixuan Cheng (成岱璇) Gaoling School of Artificial Intelligence, Renmin University of China / Microsoft Research
LLM-in-Sandboxagentic LLM training
1 篇笔记 · 已建档 Dakai An HKUST
RL post-training systemsAI infrastructure
1 篇笔记 · 已建档 Daman Arora Carnegie Mellon University / Microsoft Research India
maximum likelihood reinforcement learningreasoning
1 篇笔记 · 已建档 Daniel Khashabi Johns Hopkins University / Center for Language and Speech Processing
natural language processinglanguage model reasoning
1 篇笔记 · 已建档 Daniel R. Jiang Meta AI / University of Pittsburgh
reinforcement learningRLHF
1 篇笔记 · 已建档 Daniel Y. Fu UC San Diego / Together AI
FlashAttentionefficient sequence modeling
1 篇笔记 · 已建档 Daniele Dan Amazon / University of Padua
tool-calling RLapplied machine learning
1 篇笔记 · 已建档 Dawn Song UC Berkeley / BAIR
AI safetyAI security
1 篇笔记 · 已建档 Dilxat Muhtar Alibaba Group
agentic RL systemsRL post-training
1 篇笔记 · 已建档 Dong Yu Tencent / Tencent AI Lab
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Dongyang Ma Independent Researchers
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Dorsa Sadigh Stanford University / Google DeepMind
SPIRALset reinforcement learning
1 篇笔记 · 已建档 Enlei Gong Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Eric Nalisnick Johns Hopkins University
probabilistic machine learninguncertainty quantification
1 篇笔记 · 已建档 Fahim Tajwar Carnegie Mellon University / Stanford University
maximum likelihood reinforcement learningRLVR
1 篇笔记 · 已建档 Fangxu Yu University of Maryland, College Park / Microsoft Research (internship)
LLM reasoningon-policy distillation
1 篇笔记 · 已建档 Fangyun Wei Microsoft Research Asia / Peking University
EAGLEspeculative decoding
1 篇笔记 · 已建档 Flood Sung XVI Robotics / Moonshot AI
Kimireinforcement learning
1 篇笔记 · 已建档 Frederike Lübeck ETH Zürich / Max Planck Institute for Intelligent Systems
reinforcement learninglanguage model post-training
1 篇笔记 · 已建档 Gabriella Kazai Amazon / Microsoft
tool-calling RLinformation retrieval
1 篇笔记 · 已建档 Gang Li Texas A&M University
reinforcement learningefficient reasoning
1 篇笔记 · 已建档 Gaotang Li University of Illinois Urbana-Champaign / Google Cloud AI Research (RubricEM internship)
LLM post-trainingagentic reasoning
1 篇笔记 · 已建档 Gennady Pekhimenko University of Toronto / Vector Institute
LoRAFusionCentML
1 篇笔记 · 已建档 Guangyu Chen Moonshot AI / Kimi Team
model architectureoptimization
1 篇笔记 · 已建档 Guanning Zeng Tsinghua University / Carnegie Mellon University
maximum likelihood reinforcement learningRLVR
1 篇笔记 · 已建档 Guanqun Zhao Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Guanting Dong (董冠霆) Gaoling School of Artificial Intelligence, Renmin University of China / Beijing University of Posts and Telecommunications
long-horizon agentsagentic reinforcement learning
1 篇笔记 · 已建档 Guoxin Chen Gaoling School of Artificial Intelligence, Renmin University of China / Institute of Computing Technology, Chinese Academy of Sciences
LLM-in-Sandboxcoding agents
1 篇笔记 · 已建档 Haichao Zhu MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Hailin Zhang (张海林) Xiaomi MiMo / Peking University
MiMoMOPD
1 篇笔记 · 已建档 Haiwen Feng UC Berkeley / Impossible, Inc.
maximum likelihood reinforcement learningmultimodal foundation models
1 篇笔记 · 已建档 Haizhou Zhao Alibaba Group
ROLLasynchronous RL
1 篇笔记 · 已建档 Hanze Dong Microsoft Research / Hong Kong University of Science and Technology
ReOPDfoundation model post-training
1 篇笔记 · 已建档 Hao Cheng Microsoft Research / University of Washington
large language model agentsconversational AI
1 篇笔记 · 已建档 Hao Gu The Hong Kong University of Science and Technology
HiLS-Attentionnative sparse attention
1 篇笔记 · 已建档 Hao Kang Georgia Institute of Technology / MIT
ThunderAgentagentic inference
1 篇笔记 · 已建档 Hao Liu Google DeepMind / Carnegie Mellon University
Ring AttentionBlockwise Parallel Transformer
1 篇笔记 · 已建档 Hao Zhou (周浩) Institute for AI Industry Research, Tsinghua University / SIA-Lab of Tsinghua AIR and ByteDance Seed
large language modelsscientific discovery
1 篇笔记 · 已建档 Haobo Wang (王皓波) Zhejiang University
machine learninglarge language models
1 篇笔记 · 已建档 Haohai Sun MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Harri Edwards OpenAI (paper affiliation) / Google DeepMind
process supervisionreinforcement learning
1 篇笔记 · 已建档 Huajun Bai Tsinghua University / Tsinghua Storage Research Group
SPORKSystems for AI
1 篇笔记 · 已建档 Huatong Song (宋华彤) Gaoling School of Artificial Intelligence, Renmin University of China / IQuest Research
LLM-in-Sandboxagentic LLM training
1 篇笔记 · 已建档 Huayang Li Tencent HY Team / Tencent AI Lab
HiLS-Attentionnative sparse attention
1 篇笔记 · 已建档 Huayu Chen (陈华玉) Tsinghua University / NVIDIA Deep Imagination Research group (internship)
reinforcement learningdeep generative models
1 篇笔记 · 已建档 Huichuan Zheng Tsinghua University / Tsinghua Storage Research Group
SPORKstorage systems
1 篇笔记 · 已建档 Hunter Lightman OpenAI
process supervisionmathematical reasoning
1 篇笔记 · 已建档 Ifdita Hasan Orney Stanford University
SPIRALset reinforcement learning
1 篇笔记 · 已建档 Ilya Sutskever Safe Superintelligence Inc. / OpenAI (cofounder, former chief scientist)
deep learningscaling
1 篇笔记 · 已建档 Ion Stoica University of California, Berkeley / Sky Computing Lab
LLM-as-a-VerifierAI systems
1 篇笔记 · 已建档 Jacky Kwok Stanford University / University of California, Berkeley
LLM-as-a-Verifierverification
1 篇笔记 · 已建档 Jalaj Bhandari Meta AI / Columbia University
reinforcement learningoptimization theory
1 篇笔记 · 已建档 Jan Leike Anthropic / OpenAI (former)
AI alignmentRLHF
1 篇笔记 · 已建档 Jayashree Mohan Microsoft Research India / University of Texas at Austin (PhD)
LLM servingsystems
1 篇笔记 · 已建档 Jeff Schneider Carnegie Mellon University / Robotics Institute
maximum likelihood reinforcement learningreinforcement learning
1 篇笔记 · 已建档 Jia Li The Hong Kong University of Science and Technology (Guangzhou) / The Chinese University of Hong Kong
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Jiachen Yu Tencent / Tsinghua University
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Jiacheng Chen The Chinese University of Hong Kong / Shanghai AI Laboratory
RLVRreasoning in NLP
1 篇笔记 · 已建档 Jiajie Jin (金佳杰) Gaoling School of Artificial Intelligence, Renmin University of China
long-horizon agentsdeep research agents
1 篇笔记 · 已建档 Jiajun Zhang Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Jian Chen UC San Diego / Z Lab
DFlashMagicDec
1 篇笔记 · 已建档 Jianfeng Gao Microsoft Research / Microsoft
agentic AItool use
1 篇笔记 · 已建档 Jianlin Su (苏剑林) Moonshot AI / Sun Yat-sen University
mathematicsmachine learning
1 篇笔记 · 已建档 Jiashun Liu (刘嘉顺) Hong Kong University of Science and Technology / Alibaba Group
deep reinforcement learningLLM reinforcement learning
1 篇笔记 · 已建档 Jiawei Chen (陈家慰) Qwen Team / Alibaba Group
Qwen3-Coder-Nextcode LLMs
1 篇笔记 · 已建档 Jiaxi Yang Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen3
1 篇笔记 · 已建档 Jiayao Li MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Jiayao Tang School of Mathematical Sciences, Peking University
ECHOagentic RL
1 篇笔记 · 已建档 Jieping Ye Alibaba Group / Alibaba Cloud Data to Intelligence Lab
HydraHeadmachine learning
1 篇笔记 · 已建档 Jihua Liu Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Jincheng Xie Tsinghua University / JDT AI Infra (paper internship)
speculative decodingLLM inference
1 篇笔记 · 已建档 Jingkai Zhou MiniMax / Hangzhou Dianzi University
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Jingyu Zhang (张景昱) Johns Hopkins University / Apple AIML (research internship, 2026)
foundation model post-trainingAI alignment
1 篇笔记 · 已建档 Jinkai Hu MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Jinxi Wei Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Jinyang Wu Tsinghua University / Xi'an Jiaotong University
agent reinforcement learningon-policy skill distillation
1 篇笔记 · 已建档 Jiwu Shu Tsinghua University / Tsinghua Storage Research Group
SPORKstorage systems
1 篇笔记 · 已建档 Juanzi Li (李涓子) Tsinghua University / Knowledge Engineering Group (KEG)
IndexCachelarge language models
1 篇笔记 · 已建档 Jubayer Ibn Hamid Stanford University / Google
SPIRALset reinforcement learning
1 篇笔记 · 已建档 Junxiong Wang Together AI / Cornell University
ThunderAgentTogether AI
1 篇笔记 · 已建档 Kaixin Li Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Kaiyan Zhang (张开颜) Frontis.AI / Tsinghua University
self-improving agentsself-evolving agents
1 篇笔记 · 已建档 Karan Singhal OpenAI / Google Research
health AIAGI benefits
1 篇笔记 · 已建档 Karl Cobbe OpenAI / Stanford University
mathematical reasoningverifiers
1 篇笔记 · 已建档 Kashun Shum Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Kaveh Hassani Meta Superintelligence Labs / Meta
self-improving LLMsLLM reasoning
1 篇笔记 · 已建档 Kavosh Asadi Meta AI / Amazon
reinforcement learningvalue function optimization
1 篇笔记 · 已建档 Kevin Song University of Toronto / Vector Institute
LoRAFusioncomputer systems
1 篇笔记 · 已建档 Kewei Tu (屠可伟) ShanghaiTech University
HiLS-Attentionhierarchical sparse attention
1 篇笔记 · 已建档 Khaled Saab OpenAI / Google DeepMind
biomedical intelligencehealth AI
1 篇笔记 · 已建档 Lei Feng (冯磊) Southeast University / RIKEN
machine learningAI agents
1 篇笔记 · 已建档 Lei Zhang Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Leitian Tao University of Wisconsin–Madison / Microsoft Research
large language model post-trainingAI agents
1 篇笔记 · 已建档 Leo Liang Tencent HY Team
HiLS-Attentionnative sparse attention
1 篇笔记 · 已建档 Liang Zhao Xiaomi MiMo / Xiaomi LLM Core
MOPDMiMo
1 篇笔记 · 已建档 Lin Qu Alibaba Group
distributed trainingmachine learning infrastructure
1 篇笔记 · 已建档 Lingfeng Liu School of Mathematical Sciences, Peking University
ECHOagentic RL
1 篇笔记 · 已建档 Longtao Zheng (郑龙韬) ByteDance / Nanyang Technological University
LLM reinforcement learningcoding agents
1 篇笔记 · 已建档 Lunbin Zeng MiniMax / Huazhong University of Science and Technology
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Lunxi Cao HKUST
RL post-training systemsdistributed systems
1 篇笔记 · 已建档 Marco Pavone Stanford University / NVIDIA Research
LLM-as-a-Verifierautonomous systems
1 篇笔记 · 已建档 Matan Kalman Google Research / Google
speculative decodingtransformer efficiency
1 篇笔记 · 已建档 Matei Zaharia University of California, Berkeley / Sky Lab
distributed systemsdata systems
1 篇笔记 · 已建档 Matej Cief Amazon / Brno University of Technology
tool-calling RLnatural language processing
1 篇笔记 · 已建档 Matthieu Geist Google DeepMind / Google Brain France
reinforcement learningsequential decision making
1 篇笔记 · 已建档 Mehrdad Farajtabar Apple
LLM reasoningplanning
1 篇笔记 · 已建档 Mehul Damani Massachusetts Institute of Technology / MIT-IBM Watson AI Lab
reinforcement learninglarge language models
1 篇笔记 · 已建档 Miao Peng Tencent / The Hong Kong University of Science and Technology (Guangzhou)
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Michael Y. Li Stanford University / Princeton University
SPIRALinference compute
1 篇笔记 · 已建档 Mike Hang Wang Microsoft Research
reinforcement learningAI agents
1 篇笔记 · 已建档 Ming Lin Oracle Cloud Infrastructure
reinforcement learningreasoning language models
1 篇笔记 · 已建档 Mingxing Zhang (章明星) Tsinghua University / MADSys Lab
memory systemsdistributed systems
1 篇笔记 · 已建档 Mingxuan Wang ByteDance Seed / SIA-Lab of Tsinghua AIR and ByteDance Seed
large language modelsreasoning reinforcement learning
1 篇笔记 · 已建档 Mingxuan Xia Zhejiang University / ByteDance
large language modelsweak supervision
1 篇笔记 · 已建档 Mingze Li Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen3
1 篇笔记 · 已建档 Minshen Zhang University of California, San Diego / ShanghaiTech University
HiLS-Attentionnative sparse attention
1 篇笔记 · 已建档 Mouxiang Chen (陈谋祥) Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Nidhi Bhatia NVIDIA
generative AI inferencemodel-hardware co-design
1 篇笔记 · 已建档 Nikolaos Aletras University of Sheffield / Amazon
tool-calling RLnatural language processing
1 篇笔记 · 已建档 Nino Vieillard Google DeepMind / Google
on-policy distillationgeneralized knowledge distillation
1 篇笔记 · 已建档 Nipun Kwatra Microsoft Research India / Stanford University (PhD)
LLM servingdeep learning systems
1 篇笔记 · 已建档 Noah Goodman Stanford University / MIT
SPIRALprobabilistic cognition
1 篇笔记 · 已建档 Nuo Chen Tencent / The Hong Kong University of Science and Technology (Guangzhou)
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Nusrat Jahan Lia Fatima Institute for Global AI Research / University of Dhaka
LLM agentsagent reliability
1 篇笔记 · 已建档 Olivier Bachem Google DeepMind / Google Brain
on-policy distillationGemma
1 篇笔记 · 已建档 Omar Shaikh Stanford University / Georgia Institute of Technology
SPIRALhuman-AI grounding
1 篇笔记 · 已建档 Paul Sajda Columbia University / LIINC Lab
brain-computer interfacesneuroengineering
1 篇笔记 · 已建档 Pengyu Zhao MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Pieter Abbeel University of California, Berkeley / Berkeley Robot Learning Lab
robot learningreinforcement learning
1 篇笔记 · 已建档 Piotr Stanczyk Google DeepMind / Google
on-policy distillationmachine learning infrastructure
1 篇笔记 · 已建档 Pranav Atreya University of California, Berkeley / Berkeley Robot Learning Lab
LLM-as-a-Verifierrobot learning
1 篇笔记 · 已建档 Pulkit Agrawal Massachusetts Institute of Technology / MIT Computer Science and Artificial Intelligence Laboratory
reinforcement learningrobot learning
1 篇笔记 · 已建档 Qian Dong Tsinghua University / THUIR
IndexCacheGLM-5
1 篇笔记 · 已建档 Qianxu Wang University of California, San Diego / Peking University
machine learning systemshardware-software co-design
1 篇笔记 · 已建档 Qiaorui Chen NVIDIA
MiniMax Sparse AttentionGPU kernels
1 篇笔记 · 已建档 Qidong Su University of Toronto / Vector Institute
LoRAFusionmachine learning systems
1 篇笔记 · 已建档 Qifan Zhang Tencent / The Hong Kong University of Science and Technology (Guangzhou)
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Qiying Yu (禹棋赢) Institute for AI Industry Research, Tsinghua University / ByteDance Seed
self-supervised learningmultimodal foundation models
1 篇笔记 · 已建档 Rahul K. Arora OpenAI / University of Calgary
health AIreinforcement learning
1 篇笔记 · 已建档 Ramachandran Ramjee Microsoft Research India / University of Massachusetts Amherst (PhD)
AI infrastructureLLM serving
1 篇笔记 · 已建档 Rishabh Agarwal Google DeepMind / Mila
on-policy distillationgeneralized knowledge distillation
1 篇笔记 · 已建档 Rui Gao MiniMax / Nanjing University
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Ruisheng Cao Qwen Team / Alibaba Group
Qwen3-Coder-Nextcoding agents
1 篇笔记 · 已建档 Runheng Liu Beijing Institute of Technology / JDT AI Infra (paper internship)
speculative decodingefficient language-model inference
1 篇笔记 · 已建档 Ruslan Salakhutdinov Carnegie Mellon University / Machine Learning Department
maximum likelihood reinforcement learningdeep learning
1 篇笔记 · 已建档 Sabela Ramos Google DeepMind / Google Research
on-policy distillationreinforcement learning infrastructure
1 篇笔记 · 已建档 Sam Ade Jacobs Microsoft Research / Texas A&M University (Ph.D.)
DeepSpeedDeepSpeed Ulysses
1 篇笔记 · 已建档 Sergey Levine UC Berkeley EECS / RAIL Lab
reinforcement learningrobot learning
1 篇笔记 · 已建档 Shang Wang University of Toronto / Vector Institute
LoRAFusionCentML
1 篇笔记 · 已建档 Shaohan Huang Microsoft Research / Microsoft Research Asia
LLM-in-Sandboxlarge language models
1 篇笔记 · 已建档 Sharon Li University of Wisconsin–Madison
reliable AIagentic language-model systems
1 篇笔记 · 已建档 Shulu Li University of California, Berkeley / Fudan University
LLM-as-a-Verifierverification
1 篇笔记 · 已建档 Shuo He Nanyang Technological University / University of Electronic Science and Technology of China
agentic reinforcement learningmulti-agent systems
1 篇笔记 · 已建档 Shuo Yang Tsinghua University
agent reinforcement learningon-policy skill distillation
1 篇笔记 · 已建档 Simran Arora Together AI / Stanford University
ThunderAgentAI systems
1 篇笔记 · 已建档 Siqing Wang ByteDance
large language modelsreinforcement learning
1 篇笔记 · 已建档 Sirui Han (韓斯睿) The Hong Kong University of Science and Technology
HiLS-Attentionlarge language models
1 篇笔记 · 已建档 Siyan Zhao UCLA / Meta Superintelligence Labs
LLM post-trainingreasoning reinforcement learning
1 篇笔记 · 已建档 Size Zheng ByteDance Seed / Peking University
distributed AI systemscompute-communication overlap
1 篇笔记 · 已建档 Songquan Zhu MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Stefano Ermon Stanford University
machine learninggenerative models
1 篇笔记 · 已建档 Steven Swanson University of California, San Diego / Non-Volatile Systems Lab
computer systemsmemory and storage systems
1 篇笔记 · 已建档 Tao Ge (葛涛) Microsoft Research / Microsoft
large language model post-trainingsynthetic data
1 篇笔记 · 已建档 Teddy Lee OpenAI (paper affiliation)
human dataprocess supervision
1 篇笔记 · 已建档 Tengyang Xie University of Wisconsin-Madison / Microsoft Research
reinforcement learningmachine learning
1 篇笔记 · 已建档 Tianbao Yang Texas A&M University
optimizationmachine learning
1 篇笔记 · 已建档 Tianjian Li Johns Hopkins University / Meta FAIR (research scientist intern, 2025 and 2026)
natural language processinglanguage model post-training
1 篇笔记 · 已建档 Tianyu Zhang Huawei Noah’s Ark Lab
LLM inference accelerationspeculative decoding
1 篇笔记 · 已建档 Tianyuan Wu HKUST
distributed trainingRL post-training systems
1 篇笔记 · 已建档 Ting Jiang Z.ai
IndexCacheGLM-5
1 篇笔记 · 已建档 Tong Liu LMU Munich / Munich Center for Machine Learning
tool-calling RLagent evaluation
1 篇笔记 · 已建档 Tushar Krishna Georgia Institute of Technology / MIT
ThunderAgentcomputer architecture
1 篇笔记 · 已建档 Venmugil Elango NVIDIA
GPU systemsdistributed deep learning
1 篇笔记 · 已建档 Vineet Kosaraju OpenAI / Stanford University
mathematical reasoningverifiers
1 篇笔记 · 已建档 Vito Zhang MiniMax / Peking University
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Wayne Xin Zhao Gaoling School of Artificial Intelligence, Renmin University of China / Peking University
LLM-in-Sandboxlarge language models
1 篇笔记 · 已建档 Wei Gao HKUST / Alibaba Group
RollArtROLL
1 篇笔记 · 已建档 Wei Liu (刘威) HKUST / DeepSeek
LLM reinforcement learningcoding agents
1 篇笔记 · 已建档 Wei Wang HKUST / HKUST Big Data Institute
RollArtROLL
1 篇笔记 · 已建档 Weijia Xu Microsoft Research / University of Maryland, College Park (PhD)
generative AIagentic systems
1 篇笔记 · 已建档 Weili Xu University of Illinois Urbana-Champaign / Zhejiang University
ThunderAgentmachine learning systems
1 篇笔记 · 已建档 Weiqi Xu MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Wen Hu JDT AI Infra
speculative decodingLLM inference
1 篇笔记 · 已建档 Wenhan Ma Peking University / Xiaomi LLM Core
MOPDMiMo
1 篇笔记 · 已建档 Wenjie Wang (王文杰) University of Science and Technology of China / National University of Singapore
recommender systemscausal inference
1 篇笔记 · 已建档 Wenlin Yao Microsoft Research
foundation language modelsend-to-end reinforcement learning
1 篇笔记 · 已建档 Wenting Zhao Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 William Jurayj Johns Hopkins University / Amazon AGI (applied scientist internship, 2026)
LLM uncertainty and calibrationtest-time scaling
1 篇笔记 · 已建档 Xi Wang Johns Hopkins University
uncertainty quantificationefficient reasoning
1 篇笔记 · 已建档 Xiao Luo University of Wisconsin–Madison / University of California, Los Angeles (postdoctoral affiliation)
LLM post-trainingLLM agents
1 篇笔记 · 已建档 Xiaolong Li MiniMax / Zhejiang University
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Xiaoshuai Song (宋晓帅) Gaoling School of Artificial Intelligence, Renmin University of China / Beijing University of Posts and Telecommunications
long-horizon agentsweb information acquisition
1 篇笔记 · 已建档 Xin Jin Peking University / Key Laboratory of High Confidence Software Technologies, Peking University
computer systemscomputer networking
1 篇笔记 · 已建档 Xin Lv (吕鑫) Zhipu AI / Tsinghua University
reasoning reinforcement learningreinforcement learning infrastructure
1 篇笔记 · 已建档 Xinxing Xu Microsoft Research / Microsoft Research Asia Singapore
ReOPDfoundation models
1 篇笔记 · 已建档 Xinyu Lin National University of Singapore / Shandong University
recommender systemscausal inference
1 篇笔记 · 已建档 Xinyu Wei ShanghaiTech University
HiLS-Attentionnative sparse attention
1 篇笔记 · 已建档 Xinyu Yang Carnegie Mellon University
ThunderAgentInfiniAI Lab
1 篇笔记 · 已建档 Xu Shen Alibaba Group / Tongyi Large Model Business Unit, Alibaba Token Hub
HydraHeadLLM architecture
1 篇笔记 · 已建档 Xuandong Zhao UC Berkeley / BAIR
AI safetyreasoning LLMs
1 篇笔记 · 已建档 Xunhao Lai (赖勋豪) MiniMax / Peking University
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Xuwu Wang Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Yan Chen University of Virginia
reinforcement learningefficient reasoning
1 篇笔记 · 已建档 Yanbo Zhou University of California, San Diego / Non-Volatile Systems Lab
cloud infrastructurememory and storage systems
1 篇笔记 · 已建档 Yancheng He (贺彦程) Alibaba Group
agentic RLLLM reasoning
1 篇笔记 · 已建档 Yaniv Leviathan Google Research / Google
speculative decodingtransformer efficiency
1 篇笔记 · 已建档 Yaoyao Ding University of Toronto / Vector Institute
LoRAFusionGPU kernels
1 篇笔记 · 已建档 Yaxiang Zhang National University of Singapore
LLM reinforcement learningoptimal token baseline
1 篇笔记 · 已建档 Yesheng Liang UC San Diego / Z Lab
DFlashParoQuant
1 篇笔记 · 已建档 Yi Jing Tsinghua University / Xinya College
mechanistic interpretabilityLLM post-training
1 篇笔记 · 已建档 Yicheng Hu University of Science and Technology of China
LLM agentsrecommender systems
1 篇笔记 · 已建档 Yiding Jiang Carnegie Mellon University / Google DeepMind
maximum likelihood reinforcement learningpost-training
1 篇笔记 · 已建档 Yifei Li The Ohio State University / Peking University
LLM agentsscientific coding agents
1 篇笔记 · 已建档 Yinfang Chen University of Illinois Urbana-Champaign
ThunderAgentagentic AI
1 篇笔记 · 已建档 Yingdi Shan (闪英迪) Tsinghua University / MADSys Lab
distributed systemsstorage systems
1 篇笔记 · 已建档 Yixing Jiang Stanford University / Stanford Machine Learning Group
LLM-as-a-Verifiermedical agents
1 篇笔记 · 已建档 Yonathan Efroni Tel Aviv University / AAI Technologies
interactive learningreinforcement learning
1 篇笔记 · 已建档 Yongbin Li (李永彬) Tongyi Lab / Alibaba Group
code LLMscoding agents
1 篇笔记 · 已建档 Yongchao Zhou Google DeepMind / University of Toronto
on-policy distillationlanguage model distillation
1 篇笔记 · 已建档 Yongpan Liu (刘勇攀) Tsinghua University / Beijing National Research Center for Information Science and Technology
AI acceleratorshardware-software co-design
1 篇笔记 · 已建档 Yongwei Wu Tsinghua University / MADSys Lab
parallel systemsdistributed systems
1 篇笔记 · 已建档 Yoonho Lee Stanford University
SPIRALcontinual learning
1 篇笔记 · 已建档 Yossi Matias Google Research / Google
Google Researchspeculative decoding
1 篇笔记 · 已建档 Youliang Yu Meta AI
reinforcement learningLLM post-training
1 篇笔记 · 已建档 Youyou Lu Tsinghua University / Tsinghua Storage Research Group
SPORKcomputer systems
1 篇笔记 · 已建档 Yu Cheng The Chinese University of Hong Kong / Shanghai AI Laboratory
efficient architecturesmodel compression
1 篇笔记 · 已建档 Yu Zhang (张宇) Moonshot AI / Soochow University
scalable LLM architecturemodel-system co-design
1 篇笔记 · 已建档 Yuan He (何源) Amazon / University of Oxford
tool-calling RLagent post-training
1 篇笔记 · 已建档 Yuda Song Carnegie Mellon University / FAIR Paris
maximum likelihood reinforcement learninginteractive decision-making
1 篇笔记 · 已建档 Yue Guan University of California, San Diego / PICASSO Lab
efficient machine learningmodel compression
1 篇笔记 · 已建档 Yue Wu Alibaba Group / Alibaba Cloud
HydraHeadlarge language models
1 篇笔记 · 已建档 Yueer Zhou Zhejiang University / Stanford University
maximum likelihood reinforcement learningself-improving foundation models
1 篇笔记 · 已建档 Yuejiang Liu Stanford University / National University of Singapore
LLM-as-a-Verifierrobot learning
1 篇笔记 · 已建档 Yufei Ding University of California, San Diego / PICASSO Lab
machine learning systemsdomain-specific languages
1 篇笔记 · 已建档 Yufeng Yang MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Yuhang Yang Zhejiang University / ByteDance
large language modelstabular reasoning
1 篇笔记 · 已建档 Yuheng Jing Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Yuheng Zhao HKUST / Alibaba Group
RollArtROLL
1 篇笔记 · 已建档 Yuhui Li University of Waterloo / Peking University
EAGLEspeculative decoding
1 篇笔记 · 已建档 Yujiu Yang Tsinghua University / Tsinghua Shenzhen International Graduate School
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Yunfan Xiong Peking University / DeepSeek AI
DSparkspeculative decoding
1 篇笔记 · 已建档 Yunlong Feng Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Yuqi Wu ByteDance Seed / Shanghai Jiao Tong University
Laminarasynchronous RL
1 篇笔记 · 已建档 Yura Burda OpenAI / University of Toronto
mathematical reasoningreinforcement learning
1 篇笔记 · 已建档 Yuxian Gu Tsinghua University / Microsoft Research Asia
LLM-in-Sandboxefficient LLM training
1 篇笔记 · 已建档 Yuyang Hu (扈煜阳) Gaoling School of Artificial Intelligence, Renmin University of China / Beijing Academy of Artificial Intelligence
long-horizon agentsagent memory
1 篇笔记 · 已建档 Yuyang You School of Mathematical Sciences, Peking University
ECHOagentic RL
1 篇笔记 · 已建档 Zaifeng Pan (潘再峰) University of California, San Diego / PICASSO Lab
machine learning systemsLLM serving
1 篇笔记 · 已建档 Zekun Li MiniMax
MiniMax Sparse AttentionMiniMax-M3
1 篇笔记 · 已建档 Zeyao Ma Qwen Team / Alibaba Group
Qwen3-Coder-Nextcoding agents
1 篇笔记 · 已建档 Zeyu Chen Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Zeyu Cui Qwen Team / Alibaba Group
Qwen3-Coder-NextQwen-Coder
1 篇笔记 · 已建档 Zeyu Jia (贾泽宇) Massachusetts Institute of Technology / Peking University
reinforcement learning theorymachine learning theory
1 篇笔记 · 已建档 Zhanda Zhu University of Toronto / Vector Institute
LoRAFusionLLM systems
1 篇笔记 · 已建档 Zheng Zhang ByteDance Seed
large language modelshuman alignment
1 篇笔记 · 已建档 Zhengding Hu University of California, San Diego / PICASSO Lab
high-performance computingmachine learning systems
1 篇笔记 · 已建档 Zhenghai Xue Nanyang Technological University / Moonshot AI
reinforcement learningLLM agents
1 篇笔记 · 已建档 Zhengxiao Du Z.ai / Tsinghua University
IndexCacheGLM-5
1 篇笔记 · 已建档 Zhentao Tan Alibaba Group / Alibaba Cloud
HydraHeadhead-wise hybrid attention
1 篇笔记 · 已建档 Zhewei Kang UC Berkeley / University of Hong Kong
RLVRreasoning LLMs
1 篇笔记 · 已建档 Zhichao Wang Tencent
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Zhicheng Dou (窦志成) Gaoling School of Artificial Intelligence, Renmin University of China / Microsoft Research Asia
long-horizon agentsintelligent agents
1 篇笔记 · 已建档 Zhihui Xie (谢知晖) The University of Hong Kong / Meta Superintelligence Labs
LLM post-trainingself-improving reasoning
1 篇笔记 · 已建档 Zhijian Liu UC San Diego / Z Lab
DFlashefficient AI
1 篇笔记 · 已建档 Zhiyin Yu Peking University / Shanghai Artificial Intelligence Laboratory
data-efficient reinforcement learningLLM post-training
1 篇笔记 · 已建档 Zhonghai Wu (吴中海) Peking University
big-data machine learningsoftware and systems security
1 篇笔记 · 已建档 Zibo Lin Tencent
FlashMemoryDeepSeek-V4
1 篇笔记 · 已建档 Zichen Liu Alibaba Group
ROLLasynchronous RL
1 篇笔记 · 已建档 Zihe Liu (刘子贺) Alibaba Group / Beijing Jiaotong University
RL post-trainingLLM reasoning
1 篇笔记 · 已建档 Ziheng Jiang ByteDance Seed / ByteDance
MegaScaleMegaScale-MoE
1 篇笔记 · 已建档 Zijun Xie School of Mathematical Sciences, Peking University / Baidu Inc.
ECHOagentic RL
1 篇笔记 · 已建档 Ziqian Zhong Carnegie Mellon University / Transluce
AI safetyinterpretability
1 篇笔记 · 已建档 Ziyang Li Individual Researcher / Zhejiang University
ThunderAgentagentic inference
1 篇笔记 · 已建档 Zongle Huang Tsinghua University / Beijing National Research Center for Information Science and Technology
MoE inference accelerationLLM systems
1 篇笔记 · 已建档 Zongmeng Zhang Qwen Team / Alibaba Group
Qwen3-Coder-Nextcoding agents
3 篇笔记 · 多篇关联 Jiaheng Liu Reasoning AnalysisScaling Laws
2 篇笔记 · 多篇关联 Chengqi Deng Speculative DecodingMulti-Token Prediction
2 篇笔记 · 多篇关联 Hao Peng Training StabilityReasoning RL
2 篇笔记 · 多篇关联 Juncai Liu MoE SystemsDistributed Training
2 篇笔记 · 多篇关联 Lang Feng On-Policy DistillationAgent RL
2 篇笔记 · 多篇关联 Qinyu Chen Speculative DecodingMulti-Token Prediction
2 篇笔记 · 多篇关联 Ru Zhang RL AlgorithmReasoning RL
2 篇笔记 · 多篇关联 Wei Ye Reasoning AnalysisScaling Laws
2 篇笔记 · 多篇关联 Weize Chen Training StabilityReasoning RL
2 篇笔记 · 多篇关联 Wenhao Huang Reasoning AnalysisScaling Laws
2 篇笔记 · 多篇关联 Yuhao Shen On-Policy DistillationAgent RL
2 篇笔记 · 多篇关联 Yuxin Zuo Agent RLAgent Memory
2 篇笔记 · 多篇关联 Zhewen Hao Speculative DecodingMulti-Token Prediction
2 篇笔记 · 多篇关联 Zhiyuan Liu Training StabilityReasoning RL