Private Capture

Unlock Capture

这个站点包含私人录音与日记内容。输入密码后进入;当前浏览器会自动记住。

密码仅保存在当前浏览器本地。

从 Capture《Harness Eval:用Harness开启新的评测时代》保留问题:Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套

先在 clarify / merged 层保留这条内容,再提炼真实任务、状态与主题

Laneopenclaw-ops
Kindquestion
State[待澄清]
SourceHarness Eval:用Harness开启新的评测时代
Current Item

这条事项现在在哪一层

直接看当前 lane、kind、状态和最近一步,而不是先读长解释。

capturearchivedclarifyquestiongateholdwritebacknot readytoday-focusnot ready
Task
从 Capture《Harness Eval:用Harness开启新的评测时代》保留问题:Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套
Next Step
先在 clarify / merged 层保留这条内容,再提炼真实任务、状态与主题
Lane
openclaw-ops
Kind
question
Status
[待澄清]
Todo Projection
-
Todo Due
-
Todo Source
-
Projection
hold
Source
Harness Eval:用Harness开启新的评测时代
Source Capture

Harness Eval:用Harness开启新的评测时代

Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…

Archive
2026-09-18 02:05:51
Source
om_x100b6768e0a088a4b495869ba8c3f37
Action

状态怎么更新

capture 负责预览和溯源;真正的确认、勾选和状态变更仍落在 Todo / Today-Focus 这些真实状态源里。

这条事项当前还在 capture / clarify 预览层,先看详情和来源,再决定是否进入执行视图。

Actual Preview

为什么它还没有 writeback preview

当前这条事项还没有稳定进入 strict writeback,所以这里只展示现状和下一步。

这条事项当前处于 hold,下一步仍然是:先在 clarify / merged 层保留这条内容,再提炼真实任务、状态与主题。
Source Evidence

原始 capture 里真正记录了什么

这里直接显示 summary preview 和 transcript 片段,方便你判断这条提炼是否靠谱。

Summary Preview

Harness Eval:用Harness开启新的评测时代

Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…

Transcript Excerpt
Harness Eval:用Harness开启新的评测时代
Harness 在AI时代越来越重要。
因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。
但 Eval 不也是一套 workflow 吗?
为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数?
因此,我们把 Harness 搬进了 Evaluation。
让 Evaluator Agent 自己决定:
测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结论。

第一站,MirroS 联合国内外顶尖研究机构,以 World Model 为试验田,开源 HarnessEval。
World Model 恰好把传统评测的局限暴露得很明显:不同 case 对应不同 failure mode,需要验证的对象、证据和工具都不一样,很难被一套固定 rubric 穷尽。
所以 HarnessEval 里的 skills 不是固定检查项,而成为可以按 case 动态组合的 evaluation primitives。
评测路径本身,成为 Benchmark 的一部分。
这也是 HarnessEval 真正想做的变化:
从预先写死的 scoring pipeline,
走向可组合、扩展并持续迭代的 evaluation system。

#Harness[话题]# #AgenticAI[话题]# #Benchmark[话题]# #WorldModel[话题]# #RSI[话题]# #世界模型[话题]# #大模型[话题]# #PhysicalRSl[话题]#
Harness Eval:用Harness开启新的评测时代 Harness 在... https://xhslink.cn/o/AX2XBSNy2AA 复制这段话,然后去【小红书】就能找到笔记。
resolved_url: https://www.xiaohongshu.com/explore/6a83dce3000000002701e70b
xhs_capture_status: success
Related

同一线程里的相关事项

如果一条 capture 同时涉及多个 lane,这里可以顺手跳到其他相关 item 或 thread。