尹路珈

报告题目
面向OODA智能建模的领域专用语言与计算图优化方法
报告摘要
针对在线强化学习计算开销大的问题,提出 OODA-QPPO 分布式强化学习加速框架,设计面向 rollout 片段的队列感知双层流水线,在迭代内重叠样本生成、优势估计和训练批次构建,并通过片段跨迭代复用、自适应片段长度和有限超额采样缓解慢worker节点与流水线气泡问题,同时控制策略滞后以保持 PPO 的训练稳定性。在 JSBSim 空战和 MetaDrive 高密度交通环境上的实验表明,OODA-QPPO 相较最强竞争基线可提升训练吞吐量 12.6%–19.4%,将达到目标性能所需的壁钟时间降低 26.2%–29.4%,同时保持相当的最终任务性能。
个人简介
主要研究领域为并行分布计算、高性能仿真等,发表学术论文20余篇,CCF推荐A类期刊/会议论文10余篇。主持湖南省优秀青年基金项目,173领域基金项目等,中国计算机学会分布式计算与系统专委会青年委员