Skip to content

[Roadmap] AISBench 2026 Q3 Roadmap #431

Description

@Libotry

当前状态分析 | Current Status Analysis

项目定位:

AISBench当前作为面向AI模型的统一评测基准框架,覆盖大模型、多模态模型以及推理性能场景下的精度评测与性能测评。

随着大模型能力快速向Agent化、长上下文、多模态理解以及推理优化方向演进,传统Benchmark评测方式已经难以覆盖复杂模型能力验证需求。

AISBench Q3阶段将围绕Agent评测体系建设、指令遵循与长上下文推理评测、推理优化分析、多模型服务评测、评测结果分析以及工程易用性提升等方向持续演进,推动AISBench从“模型评测工具”向“模型能力分析工具”升级。


已有能力:

模型推理后端:

已支持HuggingFace、vLLM等主流推理后端,通过统一模型接口完成模型加载、本地推理及服务化推理适配。

评测体系:

基于现有Benchmark Pipeline,支持数据集配置、模型配置、Evaluator配置,可完成文本、多模态、Agent等场景下的精度评测。

性能测评:

支持trace数据集以及性能测试模式,可针对推理服务开展吞吐、时延等基础性能指标测评。

数据集生态:

已支持多个主流LLM、多模态评测数据集,具备数据集Adapter扩展能力。


缺口与诉求:

Agentic Coding评测能力缺失:

当前AISBench缺少针对最新的更为复杂的Agent数据集的评测能力,如Terminal-Bench-2.1, DeepSWE。

需要引入Harbor框架,统一Code Agent测评数据集适配范式,支持Terminal-Bench、DeepSWE等主流Code Agent Benchmark。


指令遵循与长上下文推理评测能力不足:

当前AISBench对于复杂指令遵循和长上下文推理场景覆盖不足,无法全面评估模型在多约束指令执行、长文本理解、信息检索和复杂推理任务中的能力。

需要支持:

  • IFBench数据集精度测评;
  • AA-LCR数据集精度测评;
  • MRCR 1M数据集测评;
  • CorpusQA 1M数据集测评。

增强AISBench对于Instruction Following和Long Context Reasoning场景的评测能力。


推理优化机制评测能力不足:

当前性能测评主要关注吞吐、TTFT、TPOT等基础指标,缺少针对推理优化技术的专项分析能力。

需要支持:

  • Prefix Cache场景数据生成;
  • Prefix Cache命中率测评;
  • 理论命中率分析与校验;
  • 投机推理采信率采集与分析;
  • Draft Token/Accepted Token统计。

Multi-LoRA服务评测能力不足:

当前AISBench主要面向单模型实例进行精度与性能评测,对于Multi-LoRA服务场景缺少专项测试能力。

随着企业侧多租户、多任务模型服务需求增加,需要支持同一基础模型加载多个LoRA Adapter场景评测。

需要支持:

  • Multi-LoRA服务性能评测;
  • 多LoRA Adapter混合请求;
  • 不同LoRA切换场景性能分析;
  • Multi-LoRA精度一致性验证。

模型输出质量分析能力不足:

当前评测结果主要关注最终Score,缺少针对异常输出样本的自动分析能力。

需要支持:

  • 重复字符检测;
  • 乱码检测;
  • 生僻无意义字符检测;
  • 输出格式异常检测;
  • BadCase自动归类分析。

Agentic化及工程易用性不足:

当前AISBench在自动化调用和工程部署方面仍存在提升空间。

需要支持:

  • 通过Prompt触发AISBench评测任务;
  • CLI直接配置常用模型参数;
  • 完善自定义配置样例和文档;
  • 清理非必要三方依赖。

Focus


Agentic Coding Evaluation

引入Harbor框架,建立统一Code Agent Benchmark适配范式。

支持:

Terminal Bench 2.1

聚焦Agent在容器化终端环境中的任务执行能力。

覆盖:

  • 系统调试;
  • 代码修改;
  • 环境配置;
  • 工具调用等真实工作流。

DeepSWE

评估Agent在复杂软件工程任务中的:

  • 代码理解;
  • 问题定位;
  • 代码修改;
  • 多步骤任务执行能力。

Harbor统一适配能力

通过Harbor统一:

  • Agent运行环境;
  • Benchmark任务执行;
  • 参数配置转换;
  • 执行结果解析;
  • 评测结果输出。

降低后续Code Agent Benchmark接入成本。


Instruction Following & Long Context Reasoning Evaluation

增强AISBench对于复杂指令遵循和长上下文推理能力评测。


IFBench

面向复杂指令遵循能力评估。

重点验证:

  • 多约束指令执行;
  • 格式遵循能力;
  • 复杂任务理解能力。

AA-LCR

面向长上下文推理能力评估。

重点验证:

  • 长文本理解;
  • 信息检索;
  • 长上下文推理能力。

MRCR 1M

评估百万Token上下文中的长距离信息检索能力。


CorpusQA 1M

评估模型在超长文档中的知识理解和问答能力。


Inference Optimization Evaluation

增强推理优化场景评测能力。


Prefix Cache Evaluation

支持:

  • Prefix Cache测试数据构造;
  • 单Prefix、多Prefix场景模拟;
  • 定长、变长请求负载构造;
  • 不同命中率目标生成;
  • 理论命中率分析;
  • 理论命中率与实际命中率校验;
  • Cache Hit Rate指标采集;
  • 性能收益分析。

覆盖真实业务多轮对话场景下Prefix Cache收益验证。


Speculative Decoding Evaluation

支持:

  • 投机推理评测配置;
  • 投机推理运行指标采集;
  • Draft Token统计;
  • Accepted Token统计;
  • Acceptance Rate计算;
  • 采信率指标展示。

实现投机推理优化效果量化分析。


Multi-LoRA Service Evaluation

增强AISBench对于多LoRA模型服务场景的评测能力。


Multi-LoRA性能测评

支持:

  • Multi-LoRA Adapter加载;
  • 多用户、多任务混合请求;
  • Adapter动态切换;
  • TTFT、TPOT、吞吐等性能指标分析。

Multi-LoRA精度测评

支持:

  • Base Model与LoRA Model效果对比;
  • 不同LoRA Adapter效果验证;
  • 多LoRA场景精度一致性分析。

Evaluation Analysis Capability

增强评测结果分析能力。


BadCase异常检测

支持大模型Response异常检测:

  • 重复字符;
  • 乱码;
  • 生僻无意义字符;
  • 空输出;
  • 格式异常。

输出:

  • 异常Case列表;
  • 异常类型统计;
  • 问题样本定位。

帮助用户从“评分结果”进一步定位模型问题。


Agentic Evaluation

增强AISBench自动化调用能力。

支持:

  • 量化场景下通过提示词运行AISBench执行评测任务;
  • 自动解析评测意图;
  • 自动生成执行参数;
  • 自动拉起Benchmark任务。

降低模型量化验证过程中的评测操作成本。


Engineering Experience

优化AISBench工程体验。

支持:

  • 常用模型参数命令行直接配置;
  • 自定义配置文件样例完善;
  • 基础功能文档覆盖;
  • 三方依赖清理;
  • 非必要依赖消减;
  • 核心依赖与场景依赖拆分。

路线图愿景 | Roadmap Vision

2026 Q3 AISBench将围绕:

  1. 基于Harbor的Agent评测体系建设
  2. 指令遵循与长上下文推理评测
  3. 推理优化专项测评
  4. Multi-LoRA服务评测能力建设
  5. 评测分析与工程体验优化

五个方向推进。

整体目标:

  • 建成统一Code Agent评测体系,支持基于Harbor的Agent Benchmark适配方式;
  • 支持Terminal-Bench 2.1、DeepSWE等主流Code Agent数据集;
  • 完善Instruction Following与Long Context Reasoning评测体系,支持IFBench、AA-LCR、MRCR 1M、CorpusQA 1M;
  • 建立Prefix Cache、投机推理专项测评能力;
  • 支持Multi-LoRA服务性能与精度评测;
  • 增强BadCase自动检测和问题定位能力;
  • 支持Prompt驱动AISBench执行评测任务;
  • 降低安装和配置成本,提高社区使用体验。

阶段性目标 | Phased Goals

本季度围绕Agent评测、指令遵循与长上下文评测、推理优化测评、多模型服务评测、评测分析能力以及工程体验优化六个方向推进,逐步完善AISBench面向新一代大模型能力的统一评测体系。


2026.08.30阶段目标

Agent评测能力建设

完成:

  • Harbor执行框架接入能力;
  • AISBench配置到Harbor参数转换能力;
  • Harbor Benchmark任务验证能力;
  • Harbor执行结果解析与统一输出能力。

支持:

  • Terminal Bench 2.1数据集测评;
  • DeepSWE数据集测评。

指令遵循与长上下文推理能力建设

完成:

  • IFBench数据集精度测评;
  • AA-LCR数据集精度测评;
  • CorpusQA 1M数据集测评。

增强:

  • 指令遵循能力评估;
  • 长上下文推理能力评估。

Multi-LoRA服务评测能力建设

完成:

  • Multi-LoRA性能测评能力;
  • Multi-LoRA精度测评能力。

支持:

  • 多LoRA Adapter请求;
  • 服务性能分析;
  • 精度一致性验证。

投机推理测评能力建设

完成:

  • 投机推理评测配置能力;
  • 投机推理运行指标采集能力;
  • 投机推理采信率指标计算能力;
  • 投机推理指标结果呈现能力。

模型输出异常分析能力建设

完成:

  • 大模型Response中重复字符、乱码及生僻无意义字符异常检测能力。

多模态推理能力建设

完成:

  • Geometry3K数据集精度测评。

工程体验优化

完成:

  • AISBench三方库非必要依赖消减。

2026.09.30阶段目标

Agent评测体系完善

完成:

  • Harbor框架完整执行链路;
  • Code Agent测评流程标准化。

长上下文评测能力建设

完成:

  • MRCR 1M数据集测评。

Prefix Cache专项测评能力建设

完成:

  • Prefix Cache测试数据构造能力;
  • Prefix Cache场景化测试能力;
  • Prefix Cache理论命中率分析与校验能力;
  • Prefix Cache指标采集与分析能力。

Agentic化能力建设

完成:

  • 支持量化场景下通过提示词运行AISBench执行评测任务。

易用性能力建设

完成:

  • 常用模型参数支持命令行直接配置;
  • 自定义配置文件样例&文档覆盖基本功能场景。

关键任务 | Key Tasks

Agentic Coding(任务1)

Harbor框架集成

引入Harbor作为Agent评测执行框架,统一:

  • Agent任务生命周期管理;
  • 环境初始化;
  • Benchmark任务执行;
  • 结果解析;
  • 评测输出格式。

Terminal Bench 2.1

评估Agent在真实终端环境中的任务执行能力。

DeepSWE

评估Agent的软件工程能力。


指令遵循与长上下文推理(任务2)

IFBench

支持复杂指令遵循能力评估。

AA-LCR

支持长上下文推理能力评估。

MRCR 1M

支持百万Token长上下文检索能力评估。

CorpusQA 1M

支持超长文档理解能力评估。


推理优化测评(任务3)

Prefix Cache

支持:

  • Prefix Cache测试数据生成;
  • 多轮对话场景模拟;
  • 命中率控制;
  • Cache指标采集;
  • 性能收益分析。

投机推理

支持:

  • Speculative Decoding配置;
  • Metrics采集;
  • Acceptance Rate计算;
  • 采信率结果展示。

Multi-LoRA服务评测(任务4)

支持:

  • Multi-LoRA性能测评;
  • Multi-LoRA精度测评;
  • 多Adapter混合请求;
  • 服务性能分析。

测评分析增强(任务5)

BadCase异常检测

建设统一异常检测模块:

  • 自动扫描模型输出;
  • 自动分类异常类型;
  • 输出问题样本。

Agentic化与工程体验优化(任务6)

Agentic化

支持:

  • Prompt驱动AISBench执行;
  • 自动生成评测命令;
  • 自动执行Benchmark任务。

易用性优化

支持:

  • CLI参数配置;
  • 配置样例完善;
  • 文档补齐;
  • 依赖消减。

补充说明 | Additional Notes

  • CI、文档、Release Notes、社区Issue响应等内容将在Q3开发过程中同步维护。
  • 所有新增能力需保持AISBench现有Benchmark接口规范,保证数据集、模型、Evaluator和结果产物的一致性。
  • Q3重点围绕业界主流Benchmark适配和复杂模型服务场景验证展开,持续沉淀可复用的数据集接入范式。

👉 如果您想要的特性不在路线图中,欢迎在此主题中发表评论或者提交功能需求issue
| If any of the features you want are not in the roadmap, please feel free to comment or submit a feature request issue

Metadata

Metadata

Assignees

No one assigned

    Labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions