Published on2026年7月30日Flow-GRPO:从采样到梯度回传的完整逻辑Autonomous-DrivingFlow-MatchingGRPO强化学习从采样、reward、advantage 到 loss 与 LoRA 梯度,追踪 Flow-GRPO 训练链路中每一步到底发生了什么。