harvey-labs
评估AI代理处理真实法律工作能力的开源基准,提供任务和评测,用于改进法律类代理。
分享到 X许可证: MIT
概述
Harvey LAB 全称 Legal Agent Benchmark,是 Harvey AI 发布的开源项目,用来衡量 LLM 代理处理真实法律工作的能力。它由两部分组成:包含指令、文档和评分标准的任务数据集,以及运行并评分代理的执行框架。教程以一个并购数据室任务为例,从环境准备讲到对比仪表盘。
主要特点
- 任务数据集包含指令、文档和评分标准
- 用于运行和评估代理的执行框架
- 由 LLM 评审执行的全部通过式评分
- 评估报告和对比仪表盘
- 可扩展模型和任务的适配器
适用场景
适合开发或比较法律领域 AI 代理、需要统一测试集的研究者和团队。README 说明任务集和执行框架仍在持续扩充。
- 上游仓库
- harveyai/harvey-labs
- GitHub 上的 fork
- Guo-astro/harvey-labs
- 上游 Star 数
- 1.4k
- 分类
- AI 智能体与大模型工具
- 编程语言
- Python
- 许可证
- MIT
- Fork 时间
- 2026-09-28
- 同步状态
- 已同步上次同步 2026-10-11
同分类更多: AI 智能体与大模型工具
Hello-Agents是学习智能体原理与实践的教程,带领读者从基础知识入门,逐步构建智能体系统和应用。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
OpenSRE 是一个开源框架,用于构建 AI 智能体,借助你的基础设施工具和工作流调查生产事故。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: Apache-2.0AI 智能体与大模型工具GitHub
Context Mode帮助AI编程代理减少上下文占用,并在对话压缩后延续工作。它通过MCP和钩子处理工具输出、会话记忆,并在支持的平台间进行路由。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
ARTEX 是一款用于资产探索和测试过程审查的自托管 AI 渗透测试系统。它在一个界面中呈现任务、发现结果、资产数据和审批流程。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: AGPL-3.0AI 智能体与大模型工具GitHub