数据治理 TOPICS · 96 · 2026/09/30 16:28

问数系统的评测集怎么建——用真实问题测真实能力

作者:向量空间AI实验室 · VDataCore 本体语义百科

问数评测集用管理层真实问题建,每次变更后回归跑一遍,答对率涨跌数据说话。

问数系统好不好,唯一可信的裁判不是厂商的演示,是您自己的真实问题:把管理层高频问题整理成评测集,每次系统变更(改口径、换模型、调检索)后回归跑一遍——答对率涨了还是跌了,数据说话。评测集是问数系统质量管理的地基。这是向量空间 JBoltAI本体语义平台项目交付中的标准配套方法。

为什么需要评测集

没有评测集的两个典型事故:

  • “改好了东墙,塌了西墙”:为了答准回款问题调了口径,结果库存问题的答案悄悄变差了——没人知道,直到老板问到;
  • 升级靠感觉:“换个新模型试试?”——效果是好是坏说不清,全凭几张截图的体感。

评测集解决的就是这两件事:变更有回归(改动不破坏存量)、升级有尺子(好坏可比)。

评测集怎么建

来源:真实问题的三个矿。

  1. 管理层高频要数的问题(第一批建网时的"黄金问题"本身就是种子);
  2. 历史上答错过的问题(错题是最有价值的题——每个修复过的错误都该进集子,防止复发);
  3. 边界问题(口径有歧义的、跨系统最远的、时间边界刁钻的)。

结构:每道题三要素。

  • 问题原文(用用户原话,不要"翻译"成标准问法——系统要经得起口语);
  • 判定要点(正确答案的关键:数值基准或判定规则、应引用的口径);
  • 难度/类别标签(属于哪个业务域、单系统还是跨系统——分组统计用)。

规模:几十条起步,持续生长。 不必追求一次几百题——首批几十道高频题就能用;此后每次答错的新题随手入库。评测集是长出来的,不是憋出来的。

怎么跑

  • 触发:口径变更、模型更换、检索调优、版本升级——每次变更后全量回归;
  • 指标:答对率(按业务域分组看)、答案是否带出处、出数时长——分组比总分重要(总体持平、某个域掉了,总分看不见);
  • 错题处理:回归发现的错误,修复后该题保留在集子里——错题永远入库。

评测集的复利

跑上半年,评测集的价值超出质量工具:

  • 它是系统能力的编年史——每个月的答对率曲线,就是平台价值的证据(给管理层汇报时,这条线比任何形容词有力);
  • 它是需求的路标——某类题持续答不好,说明那块的关系或口径欠账;
  • 它让每次讨论有据可依——“该不该换模型"从争论变成"跑一遍看看”。

常见问题(FAQ)

AI 问数系统的效果怎么科学评估? 建自己的评测集:从管理层高频问题、历史答错的题、边界难题三个来源收集(每道题含问题原文、判定要点、分类标签),几十条起步持续生长。每次系统变更(改口径/换模型/调检索)后全量回归,看答对率(按业务域分组)、是否带出处、出数时长——分组比总分重要,总体持平时某个域的下降会被总分掩盖。

问数系统升级换模型,怎么知道效果变好还是变差? 跑评测集对比:升级前后用同一批真实问题回归,答对率、出处完整度、耗时逐项比对——好坏数据说话,不靠截图体感。没有评测集的升级是开盲盒,"改好了回款、塌了库存"这类局部退化无人察觉。

评测集应该由谁来建设维护? 业务和 IT 共建:问题来自业务(管理层原话最有价值),判定要点由业务确认(什么是"答对"),IT 负责结构和跑测。日常维护成本很低——答错的新题随手入库、错题永远保留防复发,评测集是长出来的不是憋出来的。

一句话总结:用老板的原话当考题,让每次变更都先考试再上岗——评测集是问数系统质量的地基,也是给管理层看的价值曲线。


  • 了解产品:向量空间 JBoltAI本体语义平台