可能性不等于可用性

优秀的机器人演示很有价值。它说明硬件、感知、控制和软件的某种组合至少曾经完成过目标行为。但成功背后的条件往往不可见:物体位置可能经过精心选择,环境可能被简化,操作人员可能反复重置现场,而失败尝试从未出现。

真实工作不会如此理想。对象会变化,工具会磨损,光线会改变,人会打断流程,系统也需要恢复路径。一次被选中的成功运行,无法说明任务能否重复完成、需要多少准备,以及失败以后会发生什么。

证据需要上下文

湾造从开放任务简报和公开测试条件开始。系统配置、环境、尝试次数和人工干预都应被记录。具有代表性的失败同样重要,因为它们往往最清楚地揭示系统边界。

可重复并不意味着假设每次任务完全相同,而是把变化描述得足够清楚,让其他人理解什么发生了改变、为什么结果可能不同。证据应支持比较,但不应把复杂系统压缩成宣传性的单一分数。

边界也是有效产出

公开基准的价值不在于宣布一个赢家,而在于解释什么有效、在什么条件下有效、需要多少人工干预,以及哪些结论不应被推广。清楚描述限制并不是难堪,而是对开发者和场景方有用的实践知识。

因此,湾造把观察、解释和结论分开。我们不制造“谁最好”的结论,而是维护一份可以检查方法、理解条件并独立判断的公开记录。