tracked author

Nidhi Bhatia

LatentMoE 第二作者。NVIDIA 官方简介将其列为高级 AI/ML 工程师,并记录其模型—硬件协同、GPU 性能建模和分布式生成式 AI 推理方向。

1 archived notes Homepage

Related Notes

按论文归档时间排序,展示该作者在本站已经出现的材料。

归档

LatentMoE: Toward Optimal Accuracy per FLOP and Parameter in Mixture of Experts

LatentMoE 将路由专家移到低维潜空间,并把节省的权重读取与通信预算用于增加专家数和 Top k;准确率优先变体在相近参数的 95B Transformer 与 73B Mamba–Attention 设置中,全部已报下游指标均高于标准 MoE,但万亿参数服务优势仍是模拟结果。

待审阅 2601.18089-latentmoe-accuracy-per-flop-parameter MoE ArchitectureMoE SystemsServing Runtime