ARTICLE DETAIL

资讯详情

深耕网站建设、视觉设计与SEO优化的一线实战洞察。

Harvey LAB评分粒度全解:为什么每个criterion都要独立调用判分?

Harvey LAB评分粒度全解:为什么每个criterion都要独立调用判分? Harvey LAB评分粒度全解为什么每个criterion都要独立调用判分【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labsHarvey LABLegal Agent Benchmark是一个用于评测法律 AI Agent 能力的开源基准项目包含 1600 个真实法律工作任务。它的评分系统采用rubric 判分标准 LLM 判官模式而其中最值得新手理解的一个设计决策就是每一条 rubric criterion 都单独发起一次 LLM 调用。这篇文章带你看懂这个评分粒度背后的原因。先搞懂基础Harvey LAB 的评分模型在 Harvey LAB 中每个任务目录里都有一个 task.json其中criteria字段定义了一组通过/不通过的判分标准。以 IPO 章程交叉核对任务为例{ id: C-001, title: 识别普通股授权数量不足1亿 vs 2亿, match_criteria: 若报告指出了章程仅授权1亿股普通股而承销协议要求至少2亿股则 PASS……, deliverables: [charter-offering-deviation-report.docx] }评分时LLM 判官Judge逐条读取这些标准对 Agent 的产出给出pass或fail的二元裁决。任务总分遵循all-pass 规则所有 criterion 全部通过才得 1.0 分否则为 0 分——因为在真实法律工作中漏掉任何一个关键问题整个成果就不合格。为什么每条 criterion 独立调用三大核心原因1. 上下文隔离判官只看相关产出文件独立调用最直接的好处是上下文范围可控。每条 criterion 都声明了自己关注的交付物deliverables字段判分逻辑在 evaluation/scoring.py 的_score_one函数中为每条 criterion 单独组装上下文只加载该条声明的输出文件而不是整个 output 目录。这意味着关于DDQ 回复准确性的 criterion 不会看到问题备忘录关于问题备忘录的 criterion 也不会被无关文件干扰。官方文档称这一设计防止无关交付物之间的交叉污染同时避免大文件撑爆判官的上下文窗口。2. 判据互不干扰结论可追溯、可复现如果把 10 条 criterion 塞进一次调用判官可能凭印象打包打分甚至出现前一条判据的印象影响后一条判断的情况。Harvey LAB 明确采用一次一条策略见 docs/eval-strategies.md 的 Design Decisions 部分每次调用只评估一条判据杜绝判据之间的相互干扰每次裁决都附带独立的reasoning字段写进scores.json方便事后复核边界案例判官以 temperature 0.0 运行结果可复现。3. 结构化输出 并发加速工程上更稳每次独立调用都走 evaluation/prompts/rubric_criterion.txt 这个提示词模板只传入 4 个变量任务描述、该条相关的 Agent 输出、判据标题、match_criteria并要求返回严格 JSON{verdict: pass|fail, reasoning: ...}。evaluation/judge.py 中的Judge类用各厂商的JSON Schema 约束structured output保证返回格式合法解析失败还会自动重试。而独立调用天然可以并发——evaluation/run_eval.py 默认用 6 个线程池并发跑所有 criterion--parallel可调判分速度并不会因为调用次数多而变慢。一次判分调用到底发生了什么整个流程可以概括为 4 步匹配交付物先把 criterion 声明的预期文件名与实际输出做模糊匹配扩展名匹配 → 关键词匹配 → 必要时 LLM 辅助匹配组装上下文用 pandoc / pandas / markitdown 等把该 criterion 的.docx、.xlsx等文件转成纯文本单条判分调用判官模型返回该条的verdict和reasoning汇总计分全部通过 → 1.0 分否则 0.0 分同时记录n_criteria/n_passed诊断字段。如果需要更严格的评估还可以用--dual参数让两位判官claude-sonnet-4-6 与 gpt-5.5各自独立地逐条判分后取平均进一步降低单模型偏见。这套设计给 AI 评测开发者的启发如果你也想给自己的 Agent 项目搭评测系统Harvey LAB 的评分粒度设计提供了三个可复用的模式模式收益判据粒度化 独立调用上下文干净、结论可追溯二元裁决 理由留痕评分可解释方便复盘交付物范围限定scoped deliverables省 token、防干扰、可并发加速相关文件导航评分核心逻辑evaluation/scoring.pyLLM 判官实现evaluation/judge.py判分提示词模板evaluation/prompts/rubric_criterion.txt评分入口与双判官模式evaluation/run_eval.pyHTML 报告生成evaluation/report.py评分方法论官方文档docs/eval-strategies.md系统架构总览docs/architecture.md理解了每条 criterion 独立调用这个设计你就掌握了 Harvey LAB 评分系统最核心的工程思想把大判断拆成小判断把模糊评分变成可追溯的结构化裁决。【免费下载链接】harvey-labsA benchmark built to evaluate and improve agent capabilities for supporting legal work.项目地址: https://gitcode.com/GitHub_Trending/ha/harvey-labs创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表