Private Capture

Unlock Capture

这个站点包含私人录音与日记内容。输入密码后进入;当前浏览器会自动记住。

密码仅保存在当前浏览器本地。

Harness Eval:用Harness开启新的评测时代

页首只保留导读,完整正文和结构化内容继续在下方展开。

Day2026-08-19 Time02:05 SenderLily Topics任务系统 / 工作流与自动化 Entities0 ModeStructure + Text SourceArchive Complete
来源类型小红书分享
说话人Lily
归档时刻2026-09-18 02:05:51
主题任务系统 / 工作流与自动化 / AI 工具与 Codex
实体0 项
模式结构化 + 正文
Report

关键导读

先把有效信息集中到顶部:一句话总览、编号要点、待办与历史呼应。完整正文与结构化数据在下方展开。

一句话总览

Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…

01

关键洞见

  • 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
  • HarnessEval 里的 skills 不是固定检查项
  • Harness Eval:用Harness开启新的评测时代
  • Harness 在AI时代越来越重要
  • 但 Eval 不也是一套 workflow 吗
02

优先级分层

  • 高:需要验证的对象、证据和工具都不一样
  • 高:因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
  • 高:从预先写死的 scoring pipeline,
  • 中:而成为可以按 case 动态组合的 evaluation primitives
✓

待办动作

  1. 需要验证的对象、证据和工具都不一样
  2. 从预先写死的 scoring pipeline,
  3. Harness 在AI时代越来越重要
  4. 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow
  5. Harness Eval:用Harness开启新的评测时代
与历史呼应

从预先写死的 scoring pipeline, xhs_capture_status: success

本条脉络:Harness Eval:用Harness开启新的评测时代 Harness 在AI时代越来越重要。 因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。 但 Eval 不也是一套 workflow 吗? 为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数? 因此,我们把 Harness 搬进了 Evaluation。 让 Evaluator Agent 自己决定: 测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结…
完整记录 · 正文与结构化数据
Mind Map

思维导图

这里不再用摘要卡片伪装脑图,而是直接用经典 mindmap 组件来展示结构。点击分支会跳到正文。

点击节点会定位到正文,方便一边看脑图一边回看原文。

Local Relation

这条录音的局部关系图

不用先跳到全局图。这里先把当前 capture 连到的 Topic / Entity / Day,以及共享这些节点的其他记录显出来。

View
Layout
来源
聚焦
Topic Entity Capture Signal Day capture -> topic / entity / signal / day

单击右侧看详情;双击节点开浮层。这里只展示和当前录音直接相关的局部网络。

完整原始转录 · 音频文稿点击展开

Harness Eval:用Harness开启新的评测时代
Harness 在AI时代越来越重要。
因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow。
但 Eval 不也是一套 workflow 吗?
为什么 Agent 能动态规划,Benchmark 却还是固定题目、固定指标、固定分数?
因此,我们把 Harness 搬进了 Evaluation。
让 Evaluator Agent 自己决定:
测什么、怎么测、调用哪些 skills、sub-agents 和 tools,并综合证据给出结论。

第一站,MirroS 联合国内外顶尖研究机构,以 World Model 为试验田,开源 HarnessEval。
World Model 恰好把传统评测的局限暴露得很明显:不同 case 对应不同 failure mode,需要验证的对象、证据和工具都不一样,很难被一套固定 rubric 穷尽。
所以 HarnessEval 里的 skills 不是固定检查项,而成为可以按 case 动态组合的 evaluation primitives。
评测路径本身,成为 Benchmark 的一部分。
这也是 HarnessEval 真正想做的变化:
从预先写死的 scoring pipeline,
走向可组合、扩展并持续迭代的 evaluation system。

#Harness[话题]# #AgenticAI[话题]# #Benchmark[话题]# #WorldModel[话题]# #RSI[话题]# #世界模型[话题]# #大模型[话题]# #PhysicalRSl[话题]#
Harness Eval:用Harness开启新的评测时代 Harness 在... https://xhslink.cn/o/AX2XBSNy2AA 复制这段话,然后去【小红书】就能找到笔记。
resolved_url: https://www.xiaohongshu.com/explore/6a83dce3000000002701e70b
xhs_capture_status: success

Atomic Insight Layer

原子结构层

主题 / 实体 / 概念三层标签 + 逐字原话 + 出链 / 反链。点击 chip 筛选。

主题 实体 概念
全部主题洞见
topic-0

任务系统

主题
topic-1

工作流与自动化

主题
topic-2

AI 工具与 Codex

主题
insight-0

因为真正让 Agent 跑起来的,不只是模型能力,还有拆任务、调工具、找证据、做验证的一整套 workflow

洞见
insight-1

HarnessEval 里的 skills 不是固定检查项

洞见
insight-2

Harness Eval:用Harness开启新的评测时代

洞见
insight-3

Harness 在AI时代越来越重要

洞见
insight-4

但 Eval 不也是一套 workflow 吗

洞见
Normalized Tags

规范标签与同类归并

把 topic / semantic / source / entity 放到分组标签里,后面做筛选、聚类和同类合并时会更稳。

Normalized Topics
任务系统工作流与自动化AI 工具与 Codex
Normalized Provenance
Xiaohongshu
Normalized Channels
小红书
Normalized Sources
小红书分享web_link