Research Portfolio 2025

AI & Robotics
Research

强化学习 · 基础模型 · 自主系统

7 个从算法到真机部署的完整项目,覆盖机器人运动控制、具身智能决策、多智能体系统

Scroll
01Reinforcement Learning

NP3O

Barlow Twins 对比学习 · Cost-Constrained PPO · 四条腿机器人运动

基于 Barlow Twins 对比学习的下一代 PPO 变体。以 1600 轮训练超越原作者 10000 轮基线——总奖励、基座高度稳定性、运动跟踪精度全面胜出。无需特权信息蒸馏,时不变表征学习让策略在真实地形上更鲁棒。

Video

NP3O · 1600 轮

Video

NP3O · 10000 轮 Benchmark

Cost-Constrained PPO

3 项安全约束(关节限位/力矩/速度),Softplus 成本 critic,k 值退火课程

速度预测辅助头

MSE(z_vel, priv_vel)——编码器从历史状态预测机器人速度

02Visual Navigation

Open Nav

零样本视觉语言导航 · 4 模型并行感知 · LLM 语义先验 · 室内仿真 + 户外第一人称

零样本视觉语言导航系统:LLM 生成物体语义先验(共现关系、空间分区概率),GroundingDINO + YOLOv7 + SAM + BLIP2 四模型并行感知。8 种室内仿真 + 户外城市 3D 第一人称实时物体搜索,无需环境特定训练即可部署。

Video
Video

室内仿真场景 A

Video

室内仿真场景 B

Video

室内仿真场景 C

Video

室内仿真场景 D

Video

室内仿真场景 E

Video

室内仿真场景 F

Video

室内仿真场景 G

Video

室内仿真场景 H

Video

户外城市 3D 第一人称物体搜索

4 模型并行感知

GroundingDINO + YOLOv7(检测)、SAM(分割)、BLIP2(开放词汇场景描述)——每帧并行推理

语义前沿地图

3D 体素投影 + 语义标签,前沿探索由 LLM 空间先验引导

03Real-Time LLM

RRLLM

The Real Real-Time LLM · 8 头并行解码 · vLLM 推理 · AI 虚拟主播

端到端实时 LLM 推理与直播系统。SimpleTool 8 头并行解码架构消除工具调用的自回归串行瓶颈,RT-Qwen3-4B-AWQ 量化模型在消费级 GPU 上实现低延迟推理。从推理加速到 VTuber 多模态直播的完整技术栈。

运行在 Terraria 上面的效果

运行在 Terraria 上面的效果

运行在 VTuber 上面的效果

运行在 VTuber 上面的效果

RT-Qwen3-4B-AWQ 骨干

4B 量化模型,消费级 GPU,多工具协调(确认 4B 会坍缩为单工具,8B+ 才稳定多工具)

创新点 3

vLLM continuous batching + PagedAttention 高吞吐推理

04Aerial Autonomy

AIR-Planner

多智能体强化学习 + MPC · RACER 分布式集群协同探索 · ROS1→ROS2 桥接

MAPPO/MAPPG 多智能体强化学习 + MPC 混合架构的自主无人机航迹规划系统。CNN+GRU 循环策略网络配合 PopArt 自适应值归一化实现多机稳定训练;ACADO + qpOASES 实时轨迹优化保证动力学可行性;RACER 算法实现分布式集群协同探索。

Video
Video

RACER 分布式集群协同探索

RACER 分布式集群算法

swarm_exploration 多机协同探索,动态任务分配与信息共享,实现多无人机分布式覆盖搜索

ROS1→ROS2 跨版本桥接

自研桥接层兼容 ROS1 遗留节点与 ROS2 新生态,打通仿真到真机全链路

05Humanoid Robotics

RoboNaldo

Motion-Guided Curriculum RL · Unitree G1 29-DOF 人形机器人 · MuJoCo 仿真 · 全身运动控制

基于 Unitree G1 人形机器人(29 DOF)的全身运动控制策略。在 MuJoCo 中复现 motion-guided curriculum RL 训练框架,设计三阶段课程训练:Stage 1 纯动作跟踪学习踢球姿态;Stage 2 加入静态球踢射逐步引入任务 reward;Stage 3 动态球射门配合 adapt_motion_flag 和 jump_trigger。使用人类踢球动作捕捉数据重定向为 NPZ 作为 imitation target,在 body-frame(anchor frame)下设计 547 维观测(含 5 帧历史)和 29 维动作空间。Domain randomization 覆盖 6-DOF 速度扰动和 yaw 朝向扰动。在 MuJoCo 仿真中训练后达到 11 m/s 踢球速度。策略导出 ONNX 后通过 FSM 多策略状态机在真机 G1 上部署,实现行走、站立、踢球多技能切换。

Video

MuJoCo 仿真 · 动态球射门

Video

G1 行走控制 · yaw 偏转修正

NPZ 动作重定向

人类踢球动作捕捉数据(612 帧 × 50Hz,30 bodies,29 joints)通过重定向 pipeline 转换为 G1 骨架可执行的参考动作,含 Isaac Lab BFS 与 MuJoCo DFS 关节顺序的双向映射表

547 维 Body-Frame 观测

在 pelvis/torso body frame 下设计观测,含参考关节位置/速度 (58)、anchor 相对位姿 (9)、5 帧历史基座角速度 (15)、5 帧历史关节状态 (290)、5 帧历史动作 (145)、5 帧历史球/目标位…

06Multi-Agent Systems

Research Assistant

16 Agent · LangGraph 多智能体 · 学术研究全流程

LangGraph StateGraph 编排的 16 智能体学术研究全流程系统。星形拓扑下专业智能体协作完成文献检索、实验设计、论文写作;AGENTREVIEW + REBUTTALAGENT 双阶段模拟审稿流程;Chainlit 交互界面 + LangSmith 全程追踪。

Video

创新点 2

LangGraph StateGraph 编排 + PostgresSaver 持久化检查点(SQLite 本地回退)

Chainlit + CLI 双界面

Web 交互式研究 + 命令行批处理自动化

07Autonomous Flight

Tunnel Searcher

狭窄隧道自主飞行 · EDF 距离场 · B 样条轨迹优化 · FastLIO 定位

首个在 0.5m 直径真实隧道实现全方向自主飞行的四旋翼系统。EDF 距离场实时建图、一维动力学 A* 降维搜索、B 样条多目标轨迹优化联合考虑光流质量与气流扰动;FastLIO 紧耦合里程计提供无 GPS 定位;神经网络在线检测感知缺陷并触发降级恢复。

Video
Tunnel Searcher 系统架构与硬件平台

Tunnel Searcher 系统架构与硬件平台

创新点 2

EDF 距离场建图 + 霍夫圆/矩形检测 + CNN 形状分类器——实时感知隧道截面几何结构

一维动力学 A* 搜索

将 3D 隧道规划降维为沿中心线的位置-速度二维状态空间搜索,生成动力学可行初解

08Vision-Language-Navigation

Search Planner

开放词汇视觉搜索 · 2.5D A* 混合探索 · SCAN-Planner B 样条轨迹 · NP3O 运动控制

面向四足机器人的开放词汇 3D 物体搜索系统。LLM 语义引导 + YOLOv8-World v2 开放词汇检测 + CLAHE 自适应光照预处理,构建 SDF 占用网格与语义置信度地图。2.5D A* 混合 Frontier 探索按优先级执行:高置信检测 → Frontier 开发 → Frontier 探索 → 卡障逃逸。SCAN-Planner B 样条轨迹优化(双圆柱碰撞模型 + L-BFGS)输出平滑动力学可行路径,NP3O 策略(70 维观测 ONNX 推理)执行低层运动控制。WebSocket 技能服务器提供 6 项技能接口,边缘部署于 NVIDIA Jetson Orin NX。

系统架构总览

系统架构总览

语义引导混合探索

LLM 同义词扩展(~40 类)+ 2.5D A* 优先级策略——高置信检测 → Frontier 开发 → Frontier 探索 → 卡障逃逸

多地图融合

SDF 3D 对数 odds 占用网格 + 物体置信度地图 + Frontier 边界检测 + 多视角置信度融合

09Flight Control Systems

Omni Swarm

全驱动倾转旋翼 · PX4 飞控 · 控制分配 · 集群预留

基于 PX4 飞控框架的全驱动倾转旋翼控制模块。解析推力分配算法将三轴力与力矩实时映射到四个倾转舵机 + 电机,突破传统四旋翼欠驱动限制,实现悬停全向运动。uORB 消息总线深度集成,Gazebo SITL 仿真验证。

PX4 原生模块

uORB 消息总线集成,订阅姿态/角速度/遥控器输入,发布舵机/电机输出,深度嵌入 PX4 生态

SITL 仿真支持

提供完整 Gazebo SDF 模型 + ROMFS 启动脚本,可软件在环仿真验证全驱动控制逻辑

103D Reconstruction

Gaussian Splatting Pipeline

COLMAP 增量式 SfM · 3DGS 可微光栅化 · 无 CUDA 本地训练 · Web 实时查看 · 面向工厂仪器数字化

一条从手持拍摄到网页可交互三维资产的完整重建链路。COLMAP 增量式 SfM 解算相机位姿与稀疏点云,3D Gaussian Splatting 以各向异性高斯显式表达场景并通过可微光栅化优化;受限于没有独立显卡,训练改用 Rust + wgpu 的 Brush 走 Vulkan 后端,在核显笔记本上完成 15000 步优化。自研 Python 管线负责采集体检、包围盒裁剪、雾状高斯清理与正交视图测量,最终压缩为 8.1 MB 的 .ksplat 在浏览器实时渲染。下一步是把这条链路用于工厂实验仪器的数字化:把实物变成可量测、可远程查看、可按部件拆解的三维资产。

3D

浏览器内实时渲染的高斯点云(拖拽旋转 / 滚轮缩放)

训练收敛:2500 步 vs 15000 步

训练收敛:2500 步 vs 15000 步

相机位姿求解

COLMAP 增量式 SfM —— SIFT 特征提取 → 近邻匹配 → RANSAC 几何校验 → 三角化 → PnP 增量注册 + Bundle Adjustment 联合优化;注册率低于 90% 直接重拍,避免把位姿误差带进训练

无 CUDA 本地训练

改用 Rust + wgpu 实现的 Brush 走 Vulkan 后端,在 Intel 核显笔记本上跑完 15000 步(88 分钟,150 万高斯,PSNR 25.68 / SSIM 0.889),2500 步时已接近可用画质