Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。但 Eval 不也是一套 workflow 吗?为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数?因此,我们把 Harness 搬进了 Evaluation。
Harness Eval:用Harness开启新的评测时代
完整原文、主题、复核、脑图、原子层、关系网络与处理轨迹。
Harness Eval:用Harness开启新的评测时代
这条记录讲了什么
Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…
后续动作
| 动作 | 状态 | 来源 |
|---|---|---|
| 需要验证的对象、证据和工具都不一样 | 待继续 | p02 |
| 从预先写死的 scoring pipeline, | 待确认 | p03 |
查看完整 AI 结构化导读按需展开
关键导读
先把有效信息集中到顶部:一句话总览、编号要点、待办与历史呼应。完整正文与结构化数据在下方展开。
一句话总览
Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…
关键洞见
- 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
- HarnessEval 里的 skills 不是固定检查项
- Harness Eval:用Harness开启新的评测时代
- Harness 在AI时代越来越重要
- 但 Eval 不也是一套 workflow 吗
优先级分层
- 高:需要验证的对象、证据和工具都不一样
- 高:因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
- 高:从预先写死的 scoring pipeline,
- 中:而成为可以按 case 动态组合的 evaluation primitives
待办动作
- 需要验证的对象、证据和工具都不一样
- 从预先写死的 scoring pipeline,
- Harness 在AI时代越来越重要
- 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
- Harness Eval:用Harness开启新的评测时代
从预先写死的 scoring pipeline, xhs_capture_status: success
让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结论。第一站,MirroS 联合国内外顶尖研究机构,以 World Model 为试验田,开源 HarnessEval。World Model 恰好把传统评测的局限暴露得很明显:不同 case 对应不同 failure mode,需要验证的对象、证据和工具都不一样,很难被一套固定 rubric 穷尽。
所以 HarnessEval 里的 skills 不是固定检查项,而成为可以按 case 动态组合的 evaluation primitives。评测路径本身,成为 Benchmark 的一部分。这也是 HarnessEval 真正想做的变化: 从预先写死的 scoring pipeline, 走向可组合、扩展并持续迭代的 evaluation system。
#Harness[话题]# #AgenticAI[话题]# #Benchmark[话题]# #WorldModel[话题]# #RSI[话题]# #世界模型[话题]# #大模型[话题]# #PhysicalRSl[话题]# Harness Eval:用Harness开启新的评测时代 Harness 在... https://xhslink.cn/o/AX2XBSNy2AA 复制这段话,然后去【小红书】就能找到笔记。
resolved_url: https://www.xiaohongshu.com/explore/6a83dce3000000002701e70b xhs_capture_status: success
归档文档完整内容 · 含智能总结与原始标记
Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结论。 第一站,MirroS 联合国内外顶尖研究机构,以 World Model 为试验田,开源 HarnessEval。 World Model 恰好把传统评测的局限暴露得很明显:不同 case 对应不同 failure mode,需要验证的对象、证据和工具都不一样,很难被一套固定 rubric 穷尽。 所以 HarnessEval 里的 skills 不是固定检查项,而成为可以按 case 动态组合的 evaluation primitives。 评测路径本身,成为 Benchmark 的一部分。 这也是 HarnessEval 真正想做的变化: 从预先写死的 scoring pipeline, 走向可组合、扩展并持续迭代的 evaluation system。 #Harness[话题]# #AgenticAI[话题]# #Benchmark[话题]# #WorldModel[话题]# #RSI[话题]# #世界模型[话题]# #大模型[话题]# #PhysicalRSl[话题]# Harness Eval:用Harness开启新的评测时代 Harness 在... https://xhslink.cn/o/AX2XBSNy2AA 复制这段话,然后去【小红书】就能找到笔记。 resolved_url: https://www.xiaohongshu.com/explore/6a83dce3000000002701e70b xhs_capture_status: success
思维导图
这里不再用摘要卡片伪装脑图,而是直接用经典 mindmap 组件来展示结构。点击分支会跳到正文。
点击节点会定位到正文,方便一边看脑图一边回看原文。
完整主题结构
3 个主题、7 个复核单元;全部保留原文锚点。
归档结构化主题;完整分支见上方思维导图。
归档结构化主题;完整分支见上方思维导图。
归档结构化主题;完整分支见上方思维导图。
全部复核单元
原子结构层
主题 / 实体 / 概念三层标签 + 逐字原话 + 出链 / 反链。点击 chip 筛选。
任务系统
工作流与自动化
AI 工具与 Codex
因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
HarnessEval 里的 skills 不是固定检查项
Harness Eval:用Harness开启新的评测时代
Harness 在AI时代越来越重要
但 Eval 不也是一套 workflow 吗
这条录音的局部关系图
不用先跳到全局图。这里先把当前 capture 连到的 Topic / Entity / Day,以及共享这些节点的其他记录显出来。
单击右侧看详情;双击节点开浮层。这里只展示和当前录音直接相关的局部网络。
关联内容
只展示已有派生关系,不把自动相似度伪装成人工判断。
从这条 capture 派生出来的事项
点任意 item 可以继续看 gate / writeback / patch 的处理结果。
从 Capture《Harness Eval:用Harness开启新的评测时代》保留问题:Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套
先在 clarify / merged 层保留这条内容,再提炼真实任务、状态与主题
从 Capture《Harness Eval:用Harness开启新的评测时代》保留问题:Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套
先在 clarify / merged 层保留这条内容,再提炼真实任务、状态与主题
来源与处理轨迹
用于自动化排障与后续作品集历史回顾。