ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

一个 PhD 学生的两周 Agentic Workflow 压力测试报告

一个 PhD 学生的两周 Agentic Workflow 压力测试报告

相信现在很少有人不用 AI,做调研、写论文、做报告…… AI 早已浸入生活方方面面。而对 AI 的焦虑情绪也随应用场景越来越落地而蔓延。诚然,论垂直领域顶尖表现,AI 比不过人类顶尖专家,但很大一部分工作内容的组成并不需要 99 分的能力,70、80 分足够使用。

作为一个未来迟早面对择业问题的 PhD 在读学生,这种焦虑和不确定性同样在心中萦绕许久,甚至开始影响科研生活心态, 接触 Claude Code 满血 Plan 后这份情绪被进一步放大,最顶尖的模型和不限速的吞吐,开始理解为什么 X 上渲染一股 AI 取代一切的氛围,并在小红书产出了很多民科文章。

"To understand a house, one must build it." 面对 AI 焦虑,不如把自己作为变量,投入到一场“全面自动化”的压力测试。以订阅 Plan 开始纪年,一代目合拼账户坚持了 3 天封号,二代目到现在已坚持 6 天有余,算上中间戒断的两三天,总共两周左右。

一些踩坑

早期也是被 Claude Code 创始人 Boris Cherny 分享使用经验鼓动[1],尝试多并发以掩藏延时,以纯自然语言对话交互完成端到端的开发。盲目挪用这种方法很快撞到边界:

  • 垂直任务激进用 AI 取代。 博主研究领域是芯片设计,刚开始大胆地将一些实际工程需求让 AI 接手。显然模型没太在训练时见过太多 Verilog 代码,纯指挥 AI 倒也不是不能做,只是等待修正对话的时间不一定比我直接上手改来得快,并且这种开发模式很挫败积极性[2]。Boris 说的方式应该只能在 AI 比较熟悉的框架下体验比较 sweet。
  • 用社媒对话式管理开发。 如果开发能够纯以自然语言交互,纯自然语言交互最成熟的模型便是社交媒体。于是也开始在社交媒体中接入 bot,幻想能够在无聊的通勤时间也能跑跑程序看看结果,确保 AI 一直在工作。但在垂直领域开发很难绕开具体代码,而小小的手机屏幕+纯自然语言还是很难直观展示代码。而从第一性上来说,通勤可能也就周末出门会占用几个小时,提高 AI 运行时间的大头是利用上晚上睡觉的时间。

方法论

结合踩坑经验,我想需要以更加科学的方法论重新审视 AI 协作,不要 vibe coding,而是要让 agentic 可复现、可量化、可改进,尽管目前的进度离愿景尚有距离,但这构成了底层实验方法论:

  • 获取具有统计意义结果: 科学研究第一件事是搭建研究平台,确保结果具有显著性意义。在深度冲浪和调研文献后,社媒上很多推介使用方法比如 ralph loop 没有明确的结果对比,而学术界很多指标已落后实际生产。还是拿芯片设计领域举例,Verilog Eval benchmark 包含 HDL Bits 的几百个模块,每个模块长度最多 200 行,远远不能满足实际生产动辄上万上代码、数百个模块连接的复杂场景,一些更新的 benchmark 则太新很少测试数据并且不满足我的测量需求。需要自己定义测试集,测试不同供应商,并 profilling token 开销/延时占比这类量化 metric;
  • 全场景闭环优于局部打磨: 目前的 AI 只能做好纯数字任务,纯数字任务中又很难放手处理垂类任务。打通垂类要经过数百小时的磨合,且磨合本身便是违反“the bitter lesson”, 违背模型“智价比”不断增长规律。类似摩尔定律,agentic workflow 也需要对模型智能鲁棒性,有可能耗费数个月调试的 skill 规律,新模型发布直接变为技术债务。垂类研究只占生活中一部分,还有诸如看邮件、跟踪课程作业等等很多细碎事情,因此激进尝试将生活中一切数字任务用 AI 裸模和裸服务替代,打通闭环反馈迭代;
  • 按公司架构模式设计系统: 一个 AI 效用指标是 “AI 每天运行时间”,比如如果开了 3 台机器,每台机器运行 4 小时,那么算一天运行了 12 小时。这个指标量化了 AI 撬动生活的算力杠杆。而人类-AI 系统很容易在人类上成为瓶颈,随着 AI 每天产出的信息越来越多,人类不可能把握每个一个细节。让 AI 自动化的关键是赋予系统自我纠错演化的能力,参考公司架构一样协作,有 AI 调研、AI 干活、AI 验收、AI 总结改进系统,人类作为 CEO 把握大方向,而这不可避免进一步对 AI 放权。而在场景打通的早期好比创业,人类作为一个万能组件,像胶水一样粘合整个系统运作起来,迭代直到各个部门业务线稳定。

体验报告

生产力场景

进度总结:高估了网页前端开发能力,垂类场景意料之中困难,需要进一步扩大测试规模。

测试模型:

  • Claude Code + Claude Opus 4.5 / Mini Max 2.1 / Kimi K 2.5
  • Gemini CLI + Gemini 3.0 pro
  • Opencode + Claude Opus 4.5 (copilot)
  • Copilot + Claude Opus 4.5 / GPT Codex 5.1
  • Kimi k 2.5 Web

在早期测试模型尝试过 Gemini 、国产 MiniMax 2.1 和 Kimi k 2.5,切换到 Claude Opus 4.5 后交互次数显著降低,也遇到 Kimi k 2.5 在 CC 上容易上下文爆炸问题(然后不兼容 cc 的 autocompact 格式被迫清空上下文),后主要收敛在 Claude Opus 4.5 上做测试。测试包含对话式交互以及全自动 ralph loop 测试,尚未对比 claude yolo 模式。包含两个“前端”场景,AI 难以处理的芯片前端和 AI 比较熟练的网页前端。

出人意料,即使在网页前端任务上,Claude Code + Claude Opus 4.5 或者 Kimi k 2.5 Web 也很难一次成功,这里不是指一些交互审美要求,而是经常会犯一些低级错误,比如功能漏添加、布局排列明显不合理。好在无论 Opus 或者 Kimi k 2.5 都有视觉处理能力,还需要显式在提示词中提示截屏测试。

芯片任务测试两个场景,(1)让 AI 接管实际生产全 flow 前端流程以及(2)聚焦验证任务:

  • 数千行的小模块即使赋予完整的代码和测试用例也很难让 AI 理解。而靠 spec 又很难把握描述粒度的边界,本身写好一个好的 spec 不比开发 RTL 难度低,而描述过于笼统则需要频繁交互消耗开发者心力。
  • 从 ChipAgent 半年多以前放出的 demo [3] 来看就像 Claude Code CLI + 看波形的能力,于是用 MCP 复刻了相同功能。并自己构建测试集,和不看波形纯改 tb 看 log 做消融实验,在目前测试结果上来看二者没有显著性差异,波形 MCP 总体 token 和延时消耗更高但置信度较低,函待进一步扩大测试规模。不过波形 MCP 非常利好人类使用,波形完美兼容现有工作流,特别是集成测试场景,不用操作一堆 gui 界面开发体验良好很多;其次相比 tb 改一次看一次 log 频繁修改,波形作为交付格式版本更加稳定。

说回运行效率,目前实验顶多能连续跑 3 个多小时,离“覆盖睡眠时间”的目标还差得远。至于 Ralph-loop 这种方法论到底是不是智商税,我还没腾出手做消融实验去证伪。

最近社区有两个实验挺出圈,刚好撞出了 AI 自动化的“天花板”和“地板”:一个是 Cursor 挑战 7 天手搓浏览器,结果几百个 Agent 哪怕“背诵”开源代码也翻了车,这算试出了 AI 处理超大型工程的智力下限;另一个是 Opus 4.6 挑战用 Rust 写 C 编译器,据说可以编译 Linux 内核了,有一点意思。

生活场景

进度总结:接口难以获取,手机 Agent 表现惊喜

测试模型:

  • Claude Code + Claude Code Opus 4.5 + Playwright / Browser-use [4]
  • Microsoft Copilot 365
  • AutoGLM 9B

“生活场景”这一定义并不恰当,工作中的看邮件看通知也被归为这类。生活场景目的在于使用 AI 处理消息来源的接口复杂,比如上学期一门课程就有邮件、学校选课网站、课程自己论坛三个消息渠道,获取最新消息十分疲惫;邮箱一天至少要收到 10 多封邮件,以后这个数字只会只多不少;又比如规划旅游行程要在小红书、地图、美团、交通购票软件频繁切换,对于选择困难症往往定好行程也要数个小时。

相比垂直场景,这一类场景是“技术过剩、商业模式不足”。以 AutoGLM 手机 agent 为例,云端推理目前 AutoGLM 瓶颈完全在模型推理而不在操作通信上,模型仅仅 9B 表现已足够亮眼,infra 建好完全可以将吞吐拉到每秒数百乃至千 token 吞吐;而就算边缘推理,手机配上顶尖工艺 NPU,模型稍微压缩量化,9B 也完全能在本地带起来。总结消息、操作屏幕并不需要太强的智能,但 Agent 本质上在解构平台的流量话语权,于是出现豆包手机被大厂联合封杀,网站严格的反 bot 机制。关键不在技术而在商业上,如何在技术冲击下开辟出一条可行的商业模式。

这方面场景体验大部分都卡在平台拦截上,想连通校园微软邮箱只能经过 OAuto 2.0 协议,而校园邮箱似乎又有诸多限制无法打通;浏览器爬取又在和各种 WAF 较劲,账户登录又需要 2 FA 。体验最好反而是使用官方的平台,Microsoft Copilot 自带 Outlook 集成终于让我愿意每天看邮件;浏览器爬取上 Browser-use 虽然也会遇到 WAF,相比自己的策略绕过阻碍成功概率更大一些,打通完整系统还需要时间。

总结和展望

还有一些比如 DeepResearch 调研场景由于测试较少不再展开。这两周的探索有一些惊喜,但总体对实际生活改变影响不大。同时这两周探索同样也暴露三个问题:

技术债务。 尽管在实验设计之处便考虑这方面,但在生产力场景仍然很难避免 flow 与模型的竞争,AI 模型迭代发展又太快,发布一代新模型很多结论测试都失去意义。以 Anthropic 家模型为例,想要让方法论达到同样按月的迭代速度,似乎只能更大程度放权给 AI 提高自动化程度。

发布日期 模型版本 发布间隔
2024-03-04 Claude 3 系列 (Opus, Sonnet, Haiku) —
2024-06-20 Claude 3.5 Sonnet 108 天 (~3.5 个月)
2024-10-22 Claude 3.5 Sonnet (升级版) & 3.5 Haiku 124 天 (~4 个月)
2025-02-24 Claude 3.7 Sonnet 125 天 (~4 个月)
2025-05-22 Claude 4 系列 (Opus, Sonnet) 87 天 (~3 个月)
2025-08-15 Claude 4.1 Opus 85 天 (~3 个月)
2025-09-25 Claude 4.5 Sonnet 41 天 (~1.5 个月)
2025-10-30 Claude 4.5 Haiku 35 天 (~1 个月)
2025-11-20 Claude 4.5 Opus 21 天 (<1 个月)
2026-02-04 Claude 4.6 Opus 76 天 (~2.5 个月)

学习吸收效率减缓。 虽然 AI 大大加速产出工程速度,但在领域研究深度上这阵子大大减缓。一方面是很多知识是从实践中总结,AI 隔断了具体实践;另一方面 AI 只懂见过的东西,不能创造新抽象新知识。这阵子芯片相关博客产出减少相比和加大 AI 使用有一定关联。

削弱个体生产比重。 中间封号那几天空窗期,一旦 AI 被掐断,那些项目都不想手动去调,这种戒断反应在 Lab 同学里还不是个例。用惯了顶尖模型,很难没法忍受降级甚至回到纯手工开发。依赖感的背后揭露一个事实:个体在生产中的比重正在被算力这种“重资本”稀释。这事在半导体领域不是新鲜事——搞芯片个人价值需要借助昂贵的 EDA 工具和流片预算展现。一般来说,一个领域越依赖资本,个体空间越小,入场券就越贵,也就越容易形成垄断。

很显然 AI 工具的使用还有非常大的改进空间,只要相信 AI 智能会不断增强,就绕不开如何和 AI 共生的话题,以后还会继续投入探索。


  1. https://x.com/i/status/2017742741636321619 ↩︎

  2. https://www.zhihu.com/pin/1991459378382001493 ↩︎

  3. https://chipagents.ai/ ↩︎

  4. https://github.com/browser-use/browser-use ↩︎

返回列表