从起点到终点,路径必须 零碰撞
给定观测、目标与障碍物
输入视觉、深度与目标位置,输出线速度和角速度,让机器人绕过障碍到达终点。
给定观测、目标与障碍物
训练样本用 RGB、深度和目标位置作为输入
水平翻转后必须将角速度取反
RGB、深度和目标特征先独立提取
用成功率、碰撞率和 SPL 评估策略
先围绕“从起点到终点,路径必须 零碰撞”建立问题,再逐页核对本小节的机制与证据。
给定观测、目标与障碍物,模型输出线速度和角速度,形成无碰撞路径。
成功率衡量能否到达,碰撞率衡量安全,SPL 衡量路径是否高效。
训练样本用 RGB、深度和目标位置作为输入,以专家速度指令作为标签。
先围绕“场景必须隔离”建立问题,再逐页核对本小节的机制与证据。
训练、验证和测试必须按场景隔离,否则模型可能记住布局而非学会导航。
水平翻转后必须将角速度取反,否则增强会制造互相矛盾的错误标签。
行为克隆用观测到专家动作的监督配对,通过动作误差训练模型模仿专家。
先围绕“三路特征融合,输出 两个速度”建立问题,再逐页核对本小节的机制与证据。
RGB、深度和目标特征先独立提取,再融合回归线速度与角速度。
行为克隆一旦偏离专家分布会错误累积,纠错轨迹与 DAgger 用犯错状态补课。
用成功率、碰撞率和 SPL 评估策略,再用安全层拦截可能碰撞的动作。
给定观测、目标与障碍物
训练样本用 RGB、深度和目标位置作为输入
水平翻转后必须将角速度取反
RGB、深度和目标特征先独立提取
用成功率、碰撞率和 SPL 评估策略
可靠导航来自按场景划分的数据、行为克隆训练、分布偏移纠错与安全过滤。