当前状态分析 | Current Status Analysis
项目定位:
AISBench当前作为面向AI模型的统一评测基准框架,覆盖大模型、多模态模型以及推理性能场景下的精度评测与性能测评。
随着大模型能力快速向Agent化、长上下文、多模态理解以及推理优化方向演进,传统Benchmark评测方式已经难以覆盖复杂模型能力验证需求。
AISBench Q3阶段将围绕Agent评测体系建设、指令遵循与长上下文推理评测、推理优化分析、多模型服务评测、评测结果分析以及工程易用性提升等方向持续演进,推动AISBench从“模型评测工具”向“模型能力分析工具”升级。
已有能力:
模型推理后端:
已支持HuggingFace、vLLM等主流推理后端,通过统一模型接口完成模型加载、本地推理及服务化推理适配。
评测体系:
基于现有Benchmark Pipeline,支持数据集配置、模型配置、Evaluator配置,可完成文本、多模态、Agent等场景下的精度评测。
性能测评:
支持trace数据集以及性能测试模式,可针对推理服务开展吞吐、时延等基础性能指标测评。
数据集生态:
已支持多个主流LLM、多模态评测数据集,具备数据集Adapter扩展能力。
缺口与诉求:
Agentic Coding评测能力缺失:
当前AISBench缺少针对最新的更为复杂的Agent数据集的评测能力,如Terminal-Bench-2.1, DeepSWE。
需要引入Harbor框架,统一Code Agent测评数据集适配范式,支持Terminal-Bench、DeepSWE等主流Code Agent Benchmark。
指令遵循与长上下文推理评测能力不足:
当前AISBench对于复杂指令遵循和长上下文推理场景覆盖不足,无法全面评估模型在多约束指令执行、长文本理解、信息检索和复杂推理任务中的能力。
需要支持:
- IFBench数据集精度测评;
- AA-LCR数据集精度测评;
- MRCR 1M数据集测评;
- CorpusQA 1M数据集测评。
增强AISBench对于Instruction Following和Long Context Reasoning场景的评测能力。
推理优化机制评测能力不足:
当前性能测评主要关注吞吐、TTFT、TPOT等基础指标,缺少针对推理优化技术的专项分析能力。
需要支持:
- Prefix Cache场景数据生成;
- Prefix Cache命中率测评;
- 理论命中率分析与校验;
- 投机推理采信率采集与分析;
- Draft Token/Accepted Token统计。
Multi-LoRA服务评测能力不足:
当前AISBench主要面向单模型实例进行精度与性能评测,对于Multi-LoRA服务场景缺少专项测试能力。
随着企业侧多租户、多任务模型服务需求增加,需要支持同一基础模型加载多个LoRA Adapter场景评测。
需要支持:
- Multi-LoRA服务性能评测;
- 多LoRA Adapter混合请求;
- 不同LoRA切换场景性能分析;
- Multi-LoRA精度一致性验证。
模型输出质量分析能力不足:
当前评测结果主要关注最终Score,缺少针对异常输出样本的自动分析能力。
需要支持:
- 重复字符检测;
- 乱码检测;
- 生僻无意义字符检测;
- 输出格式异常检测;
- BadCase自动归类分析。
Agentic化及工程易用性不足:
当前AISBench在自动化调用和工程部署方面仍存在提升空间。
需要支持:
- 通过Prompt触发AISBench评测任务;
- CLI直接配置常用模型参数;
- 完善自定义配置样例和文档;
- 清理非必要三方依赖。
Focus
Agentic Coding Evaluation
引入Harbor框架,建立统一Code Agent Benchmark适配范式。
支持:
Terminal Bench 2.1
聚焦Agent在容器化终端环境中的任务执行能力。
覆盖:
- 系统调试;
- 代码修改;
- 环境配置;
- 工具调用等真实工作流。
DeepSWE
评估Agent在复杂软件工程任务中的:
- 代码理解;
- 问题定位;
- 代码修改;
- 多步骤任务执行能力。
Harbor统一适配能力
通过Harbor统一:
- Agent运行环境;
- Benchmark任务执行;
- 参数配置转换;
- 执行结果解析;
- 评测结果输出。
降低后续Code Agent Benchmark接入成本。
Instruction Following & Long Context Reasoning Evaluation
增强AISBench对于复杂指令遵循和长上下文推理能力评测。
IFBench
面向复杂指令遵循能力评估。
重点验证:
- 多约束指令执行;
- 格式遵循能力;
- 复杂任务理解能力。
AA-LCR
面向长上下文推理能力评估。
重点验证:
MRCR 1M
评估百万Token上下文中的长距离信息检索能力。
CorpusQA 1M
评估模型在超长文档中的知识理解和问答能力。
Inference Optimization Evaluation
增强推理优化场景评测能力。
Prefix Cache Evaluation
支持:
- Prefix Cache测试数据构造;
- 单Prefix、多Prefix场景模拟;
- 定长、变长请求负载构造;
- 不同命中率目标生成;
- 理论命中率分析;
- 理论命中率与实际命中率校验;
- Cache Hit Rate指标采集;
- 性能收益分析。
覆盖真实业务多轮对话场景下Prefix Cache收益验证。
Speculative Decoding Evaluation
支持:
- 投机推理评测配置;
- 投机推理运行指标采集;
- Draft Token统计;
- Accepted Token统计;
- Acceptance Rate计算;
- 采信率指标展示。
实现投机推理优化效果量化分析。
Multi-LoRA Service Evaluation
增强AISBench对于多LoRA模型服务场景的评测能力。
Multi-LoRA性能测评
支持:
- Multi-LoRA Adapter加载;
- 多用户、多任务混合请求;
- Adapter动态切换;
- TTFT、TPOT、吞吐等性能指标分析。
Multi-LoRA精度测评
支持:
- Base Model与LoRA Model效果对比;
- 不同LoRA Adapter效果验证;
- 多LoRA场景精度一致性分析。
Evaluation Analysis Capability
增强评测结果分析能力。
BadCase异常检测
支持大模型Response异常检测:
- 重复字符;
- 乱码;
- 生僻无意义字符;
- 空输出;
- 格式异常。
输出:
- 异常Case列表;
- 异常类型统计;
- 问题样本定位。
帮助用户从“评分结果”进一步定位模型问题。
Agentic Evaluation
增强AISBench自动化调用能力。
支持:
- 量化场景下通过提示词运行AISBench执行评测任务;
- 自动解析评测意图;
- 自动生成执行参数;
- 自动拉起Benchmark任务。
降低模型量化验证过程中的评测操作成本。
Engineering Experience
优化AISBench工程体验。
支持:
- 常用模型参数命令行直接配置;
- 自定义配置文件样例完善;
- 基础功能文档覆盖;
- 三方依赖清理;
- 非必要依赖消减;
- 核心依赖与场景依赖拆分。
路线图愿景 | Roadmap Vision
2026 Q3 AISBench将围绕:
- 基于Harbor的Agent评测体系建设
- 指令遵循与长上下文推理评测
- 推理优化专项测评
- Multi-LoRA服务评测能力建设
- 评测分析与工程体验优化
五个方向推进。
整体目标:
- 建成统一Code Agent评测体系,支持基于Harbor的Agent Benchmark适配方式;
- 支持Terminal-Bench 2.1、DeepSWE等主流Code Agent数据集;
- 完善Instruction Following与Long Context Reasoning评测体系,支持IFBench、AA-LCR、MRCR 1M、CorpusQA 1M;
- 建立Prefix Cache、投机推理专项测评能力;
- 支持Multi-LoRA服务性能与精度评测;
- 增强BadCase自动检测和问题定位能力;
- 支持Prompt驱动AISBench执行评测任务;
- 降低安装和配置成本,提高社区使用体验。
阶段性目标 | Phased Goals
本季度围绕Agent评测、指令遵循与长上下文评测、推理优化测评、多模型服务评测、评测分析能力以及工程体验优化六个方向推进,逐步完善AISBench面向新一代大模型能力的统一评测体系。
2026.08.30阶段目标
Agent评测能力建设
完成:
- Harbor执行框架接入能力;
- AISBench配置到Harbor参数转换能力;
- Harbor Benchmark任务验证能力;
- Harbor执行结果解析与统一输出能力。
支持:
- Terminal Bench 2.1数据集测评;
- DeepSWE数据集测评。
指令遵循与长上下文推理能力建设
完成:
- IFBench数据集精度测评;
- AA-LCR数据集精度测评;
- CorpusQA 1M数据集测评。
增强:
Multi-LoRA服务评测能力建设
完成:
- Multi-LoRA性能测评能力;
- Multi-LoRA精度测评能力。
支持:
- 多LoRA Adapter请求;
- 服务性能分析;
- 精度一致性验证。
投机推理测评能力建设
完成:
- 投机推理评测配置能力;
- 投机推理运行指标采集能力;
- 投机推理采信率指标计算能力;
- 投机推理指标结果呈现能力。
模型输出异常分析能力建设
完成:
- 大模型Response中重复字符、乱码及生僻无意义字符异常检测能力。
多模态推理能力建设
完成:
工程体验优化
完成:
2026.09.30阶段目标
Agent评测体系完善
完成:
- Harbor框架完整执行链路;
- Code Agent测评流程标准化。
长上下文评测能力建设
完成:
Prefix Cache专项测评能力建设
完成:
- Prefix Cache测试数据构造能力;
- Prefix Cache场景化测试能力;
- Prefix Cache理论命中率分析与校验能力;
- Prefix Cache指标采集与分析能力。
Agentic化能力建设
完成:
- 支持量化场景下通过提示词运行AISBench执行评测任务。
易用性能力建设
完成:
- 常用模型参数支持命令行直接配置;
- 自定义配置文件样例&文档覆盖基本功能场景。
关键任务 | Key Tasks
Agentic Coding(任务1)
Harbor框架集成
引入Harbor作为Agent评测执行框架,统一:
- Agent任务生命周期管理;
- 环境初始化;
- Benchmark任务执行;
- 结果解析;
- 评测输出格式。
Terminal Bench 2.1
评估Agent在真实终端环境中的任务执行能力。
DeepSWE
评估Agent的软件工程能力。
指令遵循与长上下文推理(任务2)
IFBench
支持复杂指令遵循能力评估。
AA-LCR
支持长上下文推理能力评估。
MRCR 1M
支持百万Token长上下文检索能力评估。
CorpusQA 1M
支持超长文档理解能力评估。
推理优化测评(任务3)
Prefix Cache
支持:
- Prefix Cache测试数据生成;
- 多轮对话场景模拟;
- 命中率控制;
- Cache指标采集;
- 性能收益分析。
投机推理
支持:
- Speculative Decoding配置;
- Metrics采集;
- Acceptance Rate计算;
- 采信率结果展示。
Multi-LoRA服务评测(任务4)
支持:
- Multi-LoRA性能测评;
- Multi-LoRA精度测评;
- 多Adapter混合请求;
- 服务性能分析。
测评分析增强(任务5)
BadCase异常检测
建设统一异常检测模块:
- 自动扫描模型输出;
- 自动分类异常类型;
- 输出问题样本。
Agentic化与工程体验优化(任务6)
Agentic化
支持:
- Prompt驱动AISBench执行;
- 自动生成评测命令;
- 自动执行Benchmark任务。
易用性优化
支持:
- CLI参数配置;
- 配置样例完善;
- 文档补齐;
- 依赖消减。
补充说明 | Additional Notes
- CI、文档、Release Notes、社区Issue响应等内容将在Q3开发过程中同步维护。
- 所有新增能力需保持AISBench现有Benchmark接口规范,保证数据集、模型、Evaluator和结果产物的一致性。
- Q3重点围绕业界主流Benchmark适配和复杂模型服务场景验证展开,持续沉淀可复用的数据集接入范式。
👉 如果您想要的特性不在路线图中,欢迎在此主题中发表评论或者提交功能需求issue
| If any of the features you want are not in the roadmap, please feel free to comment or submit a feature request issue
当前状态分析 | Current Status Analysis
项目定位:
AISBench当前作为面向AI模型的统一评测基准框架,覆盖大模型、多模态模型以及推理性能场景下的精度评测与性能测评。
随着大模型能力快速向Agent化、长上下文、多模态理解以及推理优化方向演进,传统Benchmark评测方式已经难以覆盖复杂模型能力验证需求。
AISBench Q3阶段将围绕Agent评测体系建设、指令遵循与长上下文推理评测、推理优化分析、多模型服务评测、评测结果分析以及工程易用性提升等方向持续演进,推动AISBench从“模型评测工具”向“模型能力分析工具”升级。
已有能力:
模型推理后端:
已支持HuggingFace、vLLM等主流推理后端,通过统一模型接口完成模型加载、本地推理及服务化推理适配。
评测体系:
基于现有Benchmark Pipeline,支持数据集配置、模型配置、Evaluator配置,可完成文本、多模态、Agent等场景下的精度评测。
性能测评:
支持trace数据集以及性能测试模式,可针对推理服务开展吞吐、时延等基础性能指标测评。
数据集生态:
已支持多个主流LLM、多模态评测数据集,具备数据集Adapter扩展能力。
缺口与诉求:
Agentic Coding评测能力缺失:
当前AISBench缺少针对最新的更为复杂的Agent数据集的评测能力,如Terminal-Bench-2.1, DeepSWE。
需要引入Harbor框架,统一Code Agent测评数据集适配范式,支持Terminal-Bench、DeepSWE等主流Code Agent Benchmark。
指令遵循与长上下文推理评测能力不足:
当前AISBench对于复杂指令遵循和长上下文推理场景覆盖不足,无法全面评估模型在多约束指令执行、长文本理解、信息检索和复杂推理任务中的能力。
需要支持:
增强AISBench对于Instruction Following和Long Context Reasoning场景的评测能力。
推理优化机制评测能力不足:
当前性能测评主要关注吞吐、TTFT、TPOT等基础指标,缺少针对推理优化技术的专项分析能力。
需要支持:
Multi-LoRA服务评测能力不足:
当前AISBench主要面向单模型实例进行精度与性能评测,对于Multi-LoRA服务场景缺少专项测试能力。
随着企业侧多租户、多任务模型服务需求增加,需要支持同一基础模型加载多个LoRA Adapter场景评测。
需要支持:
模型输出质量分析能力不足:
当前评测结果主要关注最终Score,缺少针对异常输出样本的自动分析能力。
需要支持:
Agentic化及工程易用性不足:
当前AISBench在自动化调用和工程部署方面仍存在提升空间。
需要支持:
Focus
Agentic Coding Evaluation
引入Harbor框架,建立统一Code Agent Benchmark适配范式。
支持:
Terminal Bench 2.1
聚焦Agent在容器化终端环境中的任务执行能力。
覆盖:
DeepSWE
评估Agent在复杂软件工程任务中的:
Harbor统一适配能力
通过Harbor统一:
降低后续Code Agent Benchmark接入成本。
Instruction Following & Long Context Reasoning Evaluation
增强AISBench对于复杂指令遵循和长上下文推理能力评测。
IFBench
面向复杂指令遵循能力评估。
重点验证:
AA-LCR
面向长上下文推理能力评估。
重点验证:
MRCR 1M
评估百万Token上下文中的长距离信息检索能力。
CorpusQA 1M
评估模型在超长文档中的知识理解和问答能力。
Inference Optimization Evaluation
增强推理优化场景评测能力。
Prefix Cache Evaluation
支持:
覆盖真实业务多轮对话场景下Prefix Cache收益验证。
Speculative Decoding Evaluation
支持:
实现投机推理优化效果量化分析。
Multi-LoRA Service Evaluation
增强AISBench对于多LoRA模型服务场景的评测能力。
Multi-LoRA性能测评
支持:
Multi-LoRA精度测评
支持:
Evaluation Analysis Capability
增强评测结果分析能力。
BadCase异常检测
支持大模型Response异常检测:
输出:
帮助用户从“评分结果”进一步定位模型问题。
Agentic Evaluation
增强AISBench自动化调用能力。
支持:
降低模型量化验证过程中的评测操作成本。
Engineering Experience
优化AISBench工程体验。
支持:
路线图愿景 | Roadmap Vision
2026 Q3 AISBench将围绕:
五个方向推进。
整体目标:
阶段性目标 | Phased Goals
本季度围绕Agent评测、指令遵循与长上下文评测、推理优化测评、多模型服务评测、评测分析能力以及工程体验优化六个方向推进,逐步完善AISBench面向新一代大模型能力的统一评测体系。
2026.08.30阶段目标
Agent评测能力建设
完成:
支持:
指令遵循与长上下文推理能力建设
完成:
增强:
Multi-LoRA服务评测能力建设
完成:
支持:
投机推理测评能力建设
完成:
模型输出异常分析能力建设
完成:
多模态推理能力建设
完成:
工程体验优化
完成:
2026.09.30阶段目标
Agent评测体系完善
完成:
长上下文评测能力建设
完成:
Prefix Cache专项测评能力建设
完成:
Agentic化能力建设
完成:
易用性能力建设
完成:
关键任务 | Key Tasks
Agentic Coding(任务1)
Harbor框架集成
引入Harbor作为Agent评测执行框架,统一:
Terminal Bench 2.1
评估Agent在真实终端环境中的任务执行能力。
DeepSWE
评估Agent的软件工程能力。
指令遵循与长上下文推理(任务2)
IFBench
支持复杂指令遵循能力评估。
AA-LCR
支持长上下文推理能力评估。
MRCR 1M
支持百万Token长上下文检索能力评估。
CorpusQA 1M
支持超长文档理解能力评估。
推理优化测评(任务3)
Prefix Cache
支持:
投机推理
支持:
Multi-LoRA服务评测(任务4)
支持:
测评分析增强(任务5)
BadCase异常检测
建设统一异常检测模块:
Agentic化与工程体验优化(任务6)
Agentic化
支持:
易用性优化
支持:
补充说明 | Additional Notes
👉 如果您想要的特性不在路线图中,欢迎在此主题中发表评论或者提交功能需求issue
| If any of the features you want are not in the roadmap, please feel free to comment or submit a feature request issue