背景
Data Agent 作为"自然语言 → SQL"的数据助手,其回答质量高度依赖底层模型与语义层/技能的配置。当前缺少一套自动化手段来验证:
-
升级底层 LLM(换模型/换版本)后,老问题是否还答得对;
-
修改表结构、语义层或 skill 后,是否把已有能力改退化。
一旦发生"静默退化",只能靠用户偶然发现。需要一个评测闭环持续守住质量。
目标
提供一个评测管理系统,让用户基于自身业务沉淀测试用例,系统可自动(或手动)批量运行 Agent、比对结果、生成评测报告,确保 Agent 持续优化而非悄悄变傻。
背景
Data Agent 作为"自然语言 → SQL"的数据助手,其回答质量高度依赖底层模型与语义层/技能的配置。当前缺少一套自动化手段来验证:
升级底层 LLM(换模型/换版本)后,老问题是否还答得对;
修改表结构、语义层或 skill 后,是否把已有能力改退化。
一旦发生"静默退化",只能靠用户偶然发现。需要一个评测闭环持续守住质量。
目标
提供一个评测管理系统,让用户基于自身业务沉淀测试用例,系统可自动(或手动)批量运行 Agent、比对结果、生成评测报告,确保 Agent 持续优化而非悄悄变傻。