STATUS: BUILDING INTELLIGENT AGENTS

HELLO, WORLD — I'M

Dufolk.

算法工程师 / 强化学习研究者 / 持续调试中的人类

让智能体在复杂世界中学会感知、决策与协作,也把沿途踩过的坑写进博客。

Dufolk
dufolk@random-process:~

whoami

software_engineer // game AI

cat focus.txt

reinforcement_learning multi_agent_systems robotics

echo $MOTTO

"_"

03+研究方向RESEARCH FIELDS
02顶级期刊 / 会议成果PUBLICATIONS
05+强化学习算法栈RL ALGORITHMS
仍在学习KEEP ITERATING
00
PROFILE / SYSTEM INFO

关于我

现任腾讯游戏算法工程师,关注游戏 AI、离线强化学习、分布式在线训练与多智能体决策。

研究之外,我持续记录工程实践、论文阅读和生活切片。这个博客既是知识库,也是公开的调试日志。

PythonPyTorchReinforcement LearningMulti-AgentRayROSLinuxGitOpenCVTransformer

大连理工大学

计算机科学与技术 · 硕士

强化学习 / 机器人 / 多智能体

大连理工大学

人工智能 · 本科

AI / ALGORITHM / ENGINEERING
01
EXPERIENCE / CHANGELOG

工作与实践

腾讯科技(深圳)有限公司 · 应用研究

游戏 AI 算法工程师

面向 5v5 对抗环境,提升 AI Bot 的综合表现与拟人化程度。

  • 基于行为轨迹与动作标签的动态规划解析,构建高质量训练样本。
  • 搭建 AWR 离线强化学习训练链路,优化奖励分布并改善 Bot 激进行为。
  • 集成多策略教师模型与 MoE,兼顾统一策略的拟人化、强度和稳定性。
  • 重构 Actor 与样本流,支撑数千环境并发交互和多策略分布式训练。

中国科学院自动化研究所

多智能体强化学习 · 算法实习生

研究真实场景中的多智能体围捕,完成图结构建模、网络设计、训练与泛化实验。

  • 在三对一围捕中引入引导策略与序贯决策,使性能接近理论最优。
  • 在三对三场景中以 Value Net 拟合纯策略均衡,并验证大规模泛化能力。
02
PROJECTS / EXECUTION LOG

项目经历

CORE MEMBER

开放环境多智能体群智对抗博弈

在复杂场景下完成多智能体感知、规划与博弈,负责基于 ROS 的建图、感知、行为和决策一体化系统。

  • 图结构自主探索与实机验证
  • 多智能体围捕及对抗策略
  • Flask + FFMPEG 通信与第一视角推流
ROSMARLGRAPHFLASK
ENGINEERING

矿洞巡检机器人

开发自主感知与预警系统,在 Spring Boot 中封装卷扬机控制协议,通过 Modbus 控制硬件并保存巡检日志。

ROBOTICSMODBUSSPRING BOOT
03
RESEARCH / SELECTED OUTPUT

研究成果

01
IEEE TCDS · Q1 · 学生一作

Two Heads are Better than One: Collaboration-Oriented Multi-Agent Exploration System

02
NEURIPS 2025 · CCF-A · 二作

Equilibrium Policy Generalization for Pursuit-Evasion Games via Multi-Agent Reinforcement Learning on Graphs

03
IEEE TNNLS · 一区 · 学生一作

Less Repetition, Less Energy Cost: A Multi-agent Energy-saving Autonomous Exploration System

04
HONORS / ACHIEVEMENTS

国家级奖项

第二十四届中国机器人及人工智能大赛全国总决赛二等奖

全国大学生智能技术应用大赛二等奖

第十三届蓝桥杯全国总决赛 Python 程序设计二等奖

2021 中国机器人大赛全国一等奖

第二十三届中国机器人及人工智能大赛全国总决赛三等奖

第十四届全国大学生创新创业年会“我最喜爱的项目”专项奖

END OF FILE

Stay curious.
Keep iterating.

生活有 Bug,就继续调试。

RETURN TO TOP ↑