PROFILE / SYSTEM INFO
关于我
现任腾讯游戏算法工程师,关注游戏 AI、离线强化学习、分布式在线训练与多智能体决策。
研究之外,我持续记录工程实践、论文阅读和生活切片。这个博客既是知识库,也是公开的调试日志。
PythonPyTorchReinforcement LearningMulti-AgentRayROSLinuxGitOpenCVTransformer
大连理工大学
计算机科学与技术 · 硕士
强化学习 / 机器人 / 多智能体大连理工大学
人工智能 · 本科
AI / ALGORITHM / ENGINEERINGEXPERIENCE / CHANGELOG
工作与实践
腾讯科技(深圳)有限公司 · 应用研究
游戏 AI 算法工程师
面向 5v5 对抗环境,提升 AI Bot 的综合表现与拟人化程度。
- 基于行为轨迹与动作标签的动态规划解析,构建高质量训练样本。
- 搭建 AWR 离线强化学习训练链路,优化奖励分布并改善 Bot 激进行为。
- 集成多策略教师模型与 MoE,兼顾统一策略的拟人化、强度和稳定性。
- 重构 Actor 与样本流,支撑数千环境并发交互和多策略分布式训练。
中国科学院自动化研究所
多智能体强化学习 · 算法实习生
研究真实场景中的多智能体围捕,完成图结构建模、网络设计、训练与泛化实验。
- 在三对一围捕中引入引导策略与序贯决策,使性能接近理论最优。
- 在三对三场景中以 Value Net 拟合纯策略均衡,并验证大规模泛化能力。
PROJECTS / EXECUTION LOG
项目经历
CORE MEMBER
开放环境多智能体群智对抗博弈
在复杂场景下完成多智能体感知、规划与博弈,负责基于 ROS 的建图、感知、行为和决策一体化系统。
- 图结构自主探索与实机验证
- 多智能体围捕及对抗策略
- Flask + FFMPEG 通信与第一视角推流
ENGINEERING
矿洞巡检机器人
开发自主感知与预警系统,在 Spring Boot 中封装卷扬机控制协议,通过 Modbus 控制硬件并保存巡检日志。
RESEARCH / SELECTED OUTPUT
研究成果
IEEE TCDS · Q1 · 学生一作
↗
Two Heads are Better than One: Collaboration-Oriented Multi-Agent Exploration System
NEURIPS 2025 · CCF-A · 二作
↗
Equilibrium Policy Generalization for Pursuit-Evasion Games via Multi-Agent Reinforcement Learning on Graphs
IEEE TNNLS · 一区 · 学生一作
↗
Less Repetition, Less Energy Cost: A Multi-agent Energy-saving Autonomous Exploration System
HONORS / ACHIEVEMENTS
国家级奖项
第二十四届中国机器人及人工智能大赛全国总决赛二等奖
全国大学生智能技术应用大赛二等奖
第十三届蓝桥杯全国总决赛 Python 程序设计二等奖
2021 中国机器人大赛全国一等奖
第二十三届中国机器人及人工智能大赛全国总决赛三等奖
第十四届全国大学生创新创业年会“我最喜爱的项目”专项奖
Stay curious.
Keep iterating.
生活有 Bug,就继续调试。
RETURN TO TOP ↑