约束 MDP 的代价估计偏差:安全层看起来在工作RL2026年7月29日·16 分钟阅读约束 MDP 的代价估计偏差:安全层看起来在工作区分期望约束、条件风险与硬屏蔽,解释代价 critic 偏差如何让可行集虚胖;用约束违反轨迹占比、拉格朗日乘子轨迹和安全层旁路注入验收。#强化学习#约束MDP#安全#估计偏差READ →
奖励黑客:高 return 离谱行为RL2026年7月8日·4 分钟阅读奖励黑客:高 return 离谱行为回报高但行为不对,先查 reward 是否漏约束;agent 会 exploit 仿真漏洞,不是单纯「还没训够」。#强化学习#奖励#安全READ →
安全约束:真机探索要有硬护栏RL2026年7月5日·5 分钟阅读安全约束:真机探索要有硬护栏关节限位、速度 clamp、紧急停止应放在策略外;约束 RL 是研究方向,工程上 hard guard 优先。#强化学习#安全#机器人READ →
SROS 2 基础:默认开放图的边界ROS 22026年7月2日·3 分钟阅读SROS 2 基础:默认开放图的边界权限与密钥是部署契约;先锁关键话题,区分权限失败与 QoS 失败。#ROS2#安全#SROS2READ →