harvey-labs

评估AI代理处理真实法律工作能力的开源基准,提供任务和评测,用于改进法律类代理。

分享到 X许可证: MIT

概述

Harvey LAB 全称 Legal Agent Benchmark,是 Harvey AI 发布的开源项目,用来衡量 LLM 代理处理真实法律工作的能力。它由两部分组成:包含指令、文档和评分标准的任务数据集,以及运行并评分代理的执行框架。教程以一个并购数据室任务为例,从环境准备讲到对比仪表盘。

主要特点

  • 任务数据集包含指令、文档和评分标准
  • 用于运行和评估代理的执行框架
  • 由 LLM 评审执行的全部通过式评分
  • 评估报告和对比仪表盘
  • 可扩展模型和任务的适配器

适用场景

适合开发或比较法律领域 AI 代理、需要统一测试集的研究者和团队。README 说明任务集和执行框架仍在持续扩充。

上游仓库
harveyai/harvey-labs
GitHub 上的 fork
Guo-astro/harvey-labs
上游 Star 数
1.4k
分类
AI 智能体与大模型工具
许可证
MIT
Fork 时间
2026-09-28
同步状态
已同步上次同步 2026-09-29