Skip to content

[Feature] 自动评测闭环:评测管理系统与回归测试 #48

Description

@lzq986

背景
Data Agent 作为"自然语言 → SQL"的数据助手,其回答质量高度依赖底层模型与语义层/技能的配置。当前缺少一套自动化手段来验证:

  • 升级底层 LLM(换模型/换版本)后,老问题是否还答得对;

  • 修改表结构、语义层或 skill 后,是否把已有能力改退化。

一旦发生"静默退化",只能靠用户偶然发现。需要一个评测闭环持续守住质量。

目标
提供一个评测管理系统,让用户基于自身业务沉淀测试用例,系统可自动(或手动)批量运行 Agent、比对结果、生成评测报告,确保 Agent 持续优化而非悄悄变傻。

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions