Private Capture

Unlock Capture

这个站点包含私人录音与日记内容。输入密码后进入;当前浏览器会自动记住。

密码仅保存在当前浏览器本地。

听完这期访谈终于知道为什么学不好Agent 了

完整原文、主题、复核、脑图、原子层、关系网络与处理轨迹。

时间线308 / 563

听完这期访谈终于知道为什么学不好Agent 了

2026.08.29 · 13:24xhs_shareLily6 段原文

这条记录讲了什么

听完这期访谈终于知道为什么学不好Agent 了 最近听了Lenny 采访 Dianne Penn 的节目,她从23年开始参与 Anthropic 的多个项目。Dianne 讲到 Anthropic 内部做 AI 产品时,很多时候更像是在做一套持续测试:先写 Eval,再调模型、跑测试、找失败案例,然后继续修改。 我突然被击中,因为我之前学 AI Agent,最常做的事情就是换一个 Prompt,再换一个模型,再加几条规则,然后希望它能变聪明一点。很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成。 …

6 段原文2 个主题10 个复核单元1 个实体

后续动作

动作状态来源
很多时候更像是在做一套持续测试:先写 Eval待继续p01
再调模型、跑测试、找失败案例待确认p01
我以前觉得 Eval 可能要等项目做大了再考虑待确认p03
Eval 反而应该是最先写的东西观察p03
查看完整 AI 结构化导读按需展开
Report

关键导读

先把有效信息集中到顶部:一句话总览、编号要点、待办与历史呼应。完整正文与结构化数据在下方展开。

一句话总览

听完这期访谈终于知道为什么学不好Agent 了 最近听了Lenny 采访 Dianne Penn 的节目,她从23年开始参与 Anthropic 的多个项目。Dianne 讲到 Anthropic 内部做 AI 产品时,很多时候更像是在做一套持续测试:先写 Eval,再调模型、跑测试、找失败案例,然后继续修改。 我突然被击中,因为我之前学 AI Agent,最常做的事情就是换一个 Prompt,再换一个模型,再加几条规则,然后希望它能变聪明一点。很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成。 …

01

关键洞见

  • 很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成
  • 而是“我能不能把这件事变成一个可重复、可检查、出了问题也知道该从哪里改的流程”
  • ”“你是不是只是在证明自己是对的
  • 而是帮我们发现自己是不是把问题想窄了
  • 是不是没有定义清楚
02

优先级分层

  • 高:它更像是一套固定的工作流程:先判断问题
  • 高:我以前觉得 Eval 可能要等项目做大了再考虑
  • 高:真正重要的不是“我能不能让 AI 帮我做一件事”
·

涉及实体

Claude
✓

待办动作

  1. 很多时候更像是在做一套持续测试:先写 Eval
  2. 再调模型、跑测试、找失败案例
  3. 我以前觉得 Eval 可能要等项目做大了再考虑
  4. Eval 反而应该是最先写的东西
  5. 它更像是一套固定的工作流程:先判断问题
与历史呼应

开始从怎么写出更厉害的 Prompt变成了我到底希望它稳定完成什么工作 我以前觉得 Eval 可能要等项目做大了再考虑 之前帮朋友做金融资料整理 Agent,只说“帮我总结得好一点”,其实几乎没有办法验收

原文p01

听完这期访谈终于知道为什么学不好Agent 了 最近听了Lenny 采访 Dianne Penn 的节目,她从23年开始参与 Anthropic 的多个项目。Dianne 讲到 Anthropic 内部做 AI 产品时,很多时候更像是在做一套持续测试:先写 Eval,再调模型、跑测试、找失败案例,然后继续修改。我突然被击中,因为我之前学 AI Agent,最常做的事情就是换一个 Prompt,再换一个模型,再加几条规则,然后希望它能变聪明一点。

原文p02

很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成。之前帮朋友做金融资料整理 Agent,只说“帮我总结得好一点”,其实几乎没有办法验收。更具体的要求是重点有没有漏掉,事实有没有出处,引用能不能对应原文,JSON 格式有没有出错,不确定的地方有没有老实标出来。这些其实就是 Eval,但我花了很多时间才把这个 Agent 做成一个会对资料进行反向稽查的流程。

原文p03

我以前觉得 Eval 可能要等项目做大了再考虑,但现在发现,Eval 反而应该是最先写的东西,因为没有验收标准,Prompt 写得越多,很多时候只是把混乱藏得更深。这也让我重新理解了 MCP 和 Skills。Skill 不只是一个更长的 Prompt,它更像是一套固定的工作流程:先判断问题,再调用工具,然后检查结果,最后决定要不要交付,它的价值不是让 AI 看起来更聪明,而是让它能够比较稳定地完成一类工作。

原文p04

真正重要的不是“我能不能让 AI 帮我做一件事”,而是“我能不能把这件事变成一个可重复、可检查、出了问题也知道该从哪里改的流程”。访谈里还有一段我很喜欢。Dianne 不希望 Claude 永远赞同自己,她希望 Claude 像一个优秀同事,在必要的时候提醒她:“你是不是漏看了什么?”“这个判断有没有另一种解释?”“你是不是只是在证明自己是对的?” 我觉得这对我们使用 AI 也很重要。

原文p05

AI 最有价值的时候,可能不是帮我们把话说得更漂亮,而是帮我们发现自己是不是把问题想窄了,是不是没有定义清楚,又或者只是在寻找一个赞同自己的答案。所以我现在对 AI Agent 的理解,开始从怎么写出更厉害的 Prompt变成了我到底希望它稳定完成什么工作,以及我要怎么判断它完成得好不好。这可能才是 AI 原生工作方式真正开始的地方。

原文p06

#changemyview[话题]# #Ai进化生活howto[话题]# 听完这期访谈终于知道为什么学不好Agent 了 最近听了L... http://xhslink.cn/o/2cmSWObj2Dj 复制内容后去【小红书】,直接看笔记详情。resolved_url: https://www.xiaohongshu.com/explore/6a781d890000000025007a16 xhs_capture_status: success

归档文档完整内容 · 含智能总结与原始标记
听完这期访谈终于知道为什么学不好Agent 了
最近听了Lenny 采访 Dianne Penn 的节目,她从23年开始参与 Anthropic 的多个项目。Dianne 讲到 Anthropic 内部做 AI 产品时,很多时候更像是在做一套持续测试:先写 Eval,再调模型、跑测试、找失败案例,然后继续修改。

我突然被击中,因为我之前学 AI Agent,最常做的事情就是换一个 Prompt,再换一个模型,再加几条规则,然后希望它能变聪明一点。很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成。

之前帮朋友做金融资料整理 Agent,只说“帮我总结得好一点”,其实几乎没有办法验收。更具体的要求是重点有没有漏掉,事实有没有出处,引用能不能对应原文,JSON 格式有没有出错,不确定的地方有没有老实标出来。这些其实就是 Eval,但我花了很多时间才把这个 Agent 做成一个会对资料进行反向稽查的流程。

我以前觉得 Eval 可能要等项目做大了再考虑,但现在发现,Eval 反而应该是最先写的东西,因为没有验收标准,Prompt 写得越多,很多时候只是把混乱藏得更深。

这也让我重新理解了 MCP 和 Skills。Skill 不只是一个更长的 Prompt,它更像是一套固定的工作流程:先判断问题,再调用工具,然后检查结果,最后决定要不要交付,它的价值不是让 AI 看起来更聪明,而是让它能够比较稳定地完成一类工作。真正重要的不是“我能不能让 AI 帮我做一件事”,而是“我能不能把这件事变成一个可重复、可检查、出了问题也知道该从哪里改的流程”。

访谈里还有一段我很喜欢。Dianne 不希望 Claude 永远赞同自己,她希望 Claude 像一个优秀同事,在必要的时候提醒她:“你是不是漏看了什么?”“这个判断有没有另一种解释?”“你是不是只是在证明自己是对的?”

我觉得这对我们使用 AI 也很重要。AI 最有价值的时候,可能不是帮我们把话说得更漂亮,而是帮我们发现自己是不是把问题想窄了,是不是没有定义清楚,又或者只是在寻找一个赞同自己的答案。

所以我现在对 AI Agent 的理解,开始从怎么写出更厉害的 Prompt变成了我到底希望它稳定完成什么工作,以及我要怎么判断它完成得好不好。这可能才是 AI 原生工作方式真正开始的地方。

#changemyview[话题]# #Ai进化生活howto[话题]#
听完这期访谈终于知道为什么学不好Agent 了 最近听了L... http://xhslink.cn/o/2cmSWObj2Dj 复制内容后去【小红书】,直接看笔记详情。
resolved_url: https://www.xiaohongshu.com/explore/6a781d890000000025007a16
xhs_capture_status: success
Mind Map

思维导图

这里不再用摘要卡片伪装脑图,而是直接用经典 mindmap 组件来展示结构。点击分支会跳到正文。

点击节点会定位到正文,方便一边看脑图一边回看原文。

完整主题结构

2 个主题、10 个复核单元;全部保留原文锚点。

01AI 工具与 Codex

归档结构化主题;完整分支见上方思维导图。

02产品与站点

归档结构化主题;完整分支见上方思维导图。

全部复核单元

判断 · 关键洞见很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成证据 · p02
判断 · 关键洞见而是“我能不能把这件事变成一个可重复、可检查、出了问题也知道该从哪里改的流程”证据 · p04
判断 · 关键洞见”“你是不是只是在证明自己是对的证据 · p04
判断 · 关键洞见而是帮我们发现自己是不是把问题想窄了证据 · p05
判断 · 关键洞见是不是没有定义清楚证据 · p05
意图 · 行动候选很多时候更像是在做一套持续测试:先写 Eval证据 · p01
意图 · 行动候选再调模型、跑测试、找失败案例证据 · p01
意图 · 行动候选我以前觉得 Eval 可能要等项目做大了再考虑证据 · p03
意图 · 行动候选Eval 反而应该是最先写的东西证据 · p03
意图 · 行动候选它更像是一套固定的工作流程:先判断问题证据 · p03
Atomic Insight Layer

原子结构层

主题 / 实体 / 概念三层标签 + 逐字原话 + 出链 / 反链。点击 chip 筛选。

主题 实体 概念
全部主题实体洞见
topic-0

AI 工具与 Codex

主题
topic-1

产品与站点

主题
entity-0

Claude

实体
insight-0

很多时候不是 AI “不够聪明”,而是我根本没有说清楚什么叫做对,什么叫做错,以及什么情况下才算完成

洞见
insight-1

而是“我能不能把这件事变成一个可重复、可检查、出了问题也知道该从哪里改的流程”

洞见
insight-2

”“你是不是只是在证明自己是对的

洞见
insight-3

而是帮我们发现自己是不是把问题想窄了

洞见
insight-4

是不是没有定义清楚

洞见
Local Relation

这条录音的局部关系图

不用先跳到全局图。这里先把当前 capture 连到的 Topic / Entity / Day,以及共享这些节点的其他记录显出来。

View
Layout
来源
聚焦
Topic Entity Capture Signal Day capture -> topic / entity / signal / day

单击右侧看详情;双击节点开浮层。这里只展示和当前录音直接相关的局部网络。

关联内容

只展示已有派生关系,不把自动相似度伪装成人工判断。

来源类型xhs_share
说话人Lily
归档时刻2026-08-29 13:24:01
主题AI 工具与 Codex / 产品与站点
实体1 项
模式结构化 + 正文

来源与处理轨迹

用于自动化排障与后续作品集历史回顾。

原始内容记录xhs_share
归档进入 Capturesingle_link
结构化视图生成2 个主题 · 10 个复核单元