PAN / JIANHAO

PORTFOLIO / 2025-2026

项目不是名词,
是我真正承担过的
问题与判断。

以下内容来自项目汇报、研究作品集和履历材料。正在进行的工作明确标注状态;所有指标均保留其对应的实验条件或“初步评测”限定,不把研究过程伪装成最终结论。

01 / 进行中

自动驾驶世界模拟器与候选轨迹验证

清华大学车辆与运载学院 · 李骏院士团队 · 2026.04 - 至今

参与比亚迪商用车自动驾驶世界模拟器联合科研项目,聚焦复杂交通场景的闭环仿真和候选轨迹验证。我的工作覆盖两条连接研究与工程的链路:让多保真仿真能够稳定对齐,也让验证器能够在不逐候选重演仿真的条件下,对轨迹做提前评分。

Surprise-JEPA 轨迹验证

以历史驾驶序列的真实未来为训练信号,将训练期 prediction error 蒸馏为推理期评分;用 world/action swap 与轨迹扰动构造反事实样本,降低对单一 Planner hidden token 的依赖。

多保真闭环系统

参与 SUMO- TruckSim-CARLA-3DGS 系统,负责跨 Windows/Linux 的 Actor Identity、车辆状态与时钟同步;以 TraCI 语义和 SUMO SSM 风险指标驱动 Fidelity Scheduler。

另负责 CARLA-3DGS 与 MAN/nuPlan 场景编译链路:对齐车辆位姿、3DGS 场景坐标与相机外参,驱动约 482 万个 Gaussians 连续渲染,并输出可供 Cosmos 多视角生成与端到端驾驶评测使用的 World Scenario Map。

4.82M

连续驱动渲染的 Gaussians

4

SUMO / TruckSim / CARLA / 3DGS 联合仿真层

2

验证器的关键判断:评分优势与不确定性门槛

输入

MAN / nuPlan 场景、自车状态、动态交通参与者与地图时序。

编译

统一为 World Scenario Map,保持仿真实体与渲染实体的身份一致性。

闭环

SUMO 负责大规模背景流,风险事件进入 TruckSim 与 CARLA 的高保真链路。

验证

Surprise-JEPA 以评分优势与不确定性门槛决定是否建议替换候选轨迹。

02 / RESEARCH INTERNSHIP

风险感知的自适应运动生成

中国科学院自动化研究所 · 2025.10 - 2026.04

物理人机协作里,固定的扩散去噪预算无法同时兼顾低风险场景的实时性和高风险场景的安全性。这个课题把“花多少计算”本身建模为决策问题。

实时风险建模

将 21 个人体关键点与 UR5 基座、末端组成 23 节点时空图,用 BlockGCN 和多尺度时间卷积提取运动趋势,融合 SDF 最小距离与 TTC 得到连续风险值。

PPO / GAE 路由

将 20-50 步 DDIM NFE 设为离散动作,状态包含风险、diffusion state 与任务条件,奖励同时约束生成质量、碰撞安全与计算成本;采用“预训练 MDM-DiT,冻结生成器训练 Scheduler”的两阶段流程。

物理原型

搭建 AMASS、HumanML3D、BABEL、KIT 多源动作处理与 SMPL-UR5 对齐管线;参与 Isaac Sim / ROS2 与 MoveIt2 动态约束接口联调。

ARCHITECTURE & TRAINING MATERIAL

DiT 动作生成主干:以任务文本、扩散时间与动作状态为条件,先完成生成器预训练。
风险估计链路:23 个物理节点的时空图,经 ST-GCN 编码后,与 SDF / TTC 几何风险融合。
轻量策略网络:读取 risk embedding、diffusion state 和条件嵌入,在 10-50 步候选预算中选择动作。
两阶段训练:冻结生成器后用奖励信号优化 Step Selection Network,平衡质量、安全和推理成本。

95.6%

风险感知初步准确率

<5 ms

单帧风险推理延迟

2.1%

1,500 组场景中的碰撞率

66.8 ms

单卡 RTX 4090 端到端延迟

初步评测:FID 9.58,平均 NFE 20.7。指标来自 1,500 组场景、单卡 RTX 4090 的项目实验,仍需在更广泛任务与物理条件下验证。

03 / NATIONAL INNOVATION PROJECT

可动物体的文本驱动 3D 人-物交互生成

核心架构与算法成员 · 2026.05 - 至今

面向门、柜门和箱盖等可动物体,研究人体动作、精细手部接触与部件关节运动的协同生成。项目在校内遴选中排名第一,获 2026 年国家级大学生创新创业训练计划立项。

异步去噪与结构化状态

将 body、hand、object 解耦为独立 token 和差异化 noise schedule,以 cross-attention 让较早恢复的模态引导高噪声模态;把状态从 220 维扩展至 368 维,覆盖双手姿态、finger-part contact graph 与关节状态 q(t)。

动态接触与长时序约束

依据 q(t) 和运动学树做 Forward Kinematics,逐帧恢复目标部件动态表面;参与可微手部运动学、关节限位、穿透与抓握保持约束,并按“接近-抓握-驱动-保持-释放”组织长时序交互。

6.0 mm

接触区域平均距离下降

9.1 mm

远端手指区域距离下降

+6.1 pp

2 cm 接触召回率提升

ARCHITECTURE & DATA EXTENSION

总体架构:基于 MaMi-HOI 的粗全身交互结果,先识别接触阶段,再激活 Finger-local Geometry Adapter。
FGA 细节:每个手部关节在自身局部坐标系查询邻域表面,用共享编码器和时空注意力预测残差。
数据扩展:在原始全身 HOI 样本上追加 hand fields、局部表面几何字段与 contact-aware 字段。
受控场景截图:局部手部几何模型在全身运动不变的前提下,改善把手附近的细粒度接触。

BASELINE / BEFORE REFINEMENT

旧版:全身动作可用,但手部接触仍是明显短板

这段旧版视频没有引入 Finger-local Geometry Adapter。它保留了原始 MaMi-HOI 的宏观动作能力,但没有以关节局部表面几何来纠正手指的悬浮、穿透或不合理握持。

红圈图是原始 PPT 的定性证据板:它将行李箱把手和雨伞握柄附近的局部失败点直接标出,是本项目“为什么要做手部细化”的视觉起点。

原始 PPT 定性对比板:红圈显示需要进一步处理的局部接触区域。

OLD BASELINE VIDEO

CURRENT / AFTER REFINEMENT

当前受控案例:用局部几何与时序建模细化接触

以下案例展示手部细化原型的当前结果。它们用于观察全身动作保持和局部接触改善;目前仍是受控场景中的定性证据,不宣称为跨物体类别或物理验证完成的系统。

UMBRELLA CASE

CLOSE-UP CASE

SUITCASE CASE

04 / COMPUTER VISION

射箭训练视觉检测与计分系统

BNBU - 国家体育总局合作项目 · 2025.06 - 2025.10

增量时序感知

通过 before/after 共享编码器、feature difference、cross-attention 与历史 target memory,只预测本次射击新增箭的实例、根部、方向与可见性。

多视角落点恢复

基于标定、极线约束与靶平面投影完成跨视角关联,用箭杆中心线恢复入靶点,再以鲁棒重投影优化和 uncertainty weighting 融合结果。

可追溯事件链路

以 shot_id / arrow_id 组织前后帧、标定和模型输出,依 prediction entropy、多视角分歧和压线距离筛选难例回流,支持逐箭回放与人工复核。