单模型测试报告

① 三模块水平总览
这一屏用三个分数概括这个方案的完整价值:编排看它组织查询过程有多高效、多可靠;本体看它对数据库和业务概念的了解有多准;执行看它写出的查询和给出的答案有多靠谱。三个分数合起来,就是这个方案作为智能查数助手的总评。
② 模块维度明细
上面的总分拆成一件件具体的事,这里逐条展示:每个维度测的是什么、这次做到几分。哪一条最短,就是哪个环节在拖后腿,改进方向一目了然。
③ 单题七维指标
这是评测的原始底账:探索轮次、回答正确率、查询语法、选库、事实漂移、回答完整性和耗时。雷达图看整体轮廓(面积越大越均衡),下面的卡片给每个指标的精确数字,想查证某个分数怎么来的,看这里。
雷达口径:轮次、事实漂移、平均耗时按"越少越好"归一化;各轴满分均为 100%。
七轴:探索效率 / 结果正确 / 查询语法 / 选库 / 事实一致 / 回答完整 / 耗时效率。
④ 逐题证据
每道题问得怎么样,这里都有底:哪道全对、哪道跑偏、答中了哪些关键信息。上图先按难度汇总(看难题上是否明显退化),下表逐题定位具体现象。
指标说明

模块水平

编排水平:衡量 Agent 编排流程的整体水平,包括 PDCA 循环组织、收手条件、规则执行。计算:它主导的维度分取平均,再按单题占六成、连续追问占四成合成。

本体水平:衡量 Neo4j 本体(场景定义、术语、数据映射)给查询带来的整体价值。计算方式同上;小境没有本体,此项显示"无本体"。

执行水平:衡量底层大模型生成查询和答案的整体水平。计算方式同上。

维度(单题)

探索效率:衡量实际探索轮数是否接近理想轮数。计算:1 减去(实际轮数与期望轮数之差除以 5),折算成百分数。

回答完整性:衡量一道题有多个子问题时是否逐一回应。计算:回答覆盖的子问题数占总子问题数的比例。

冗余控制:衡量是否反复做相同的探索。计算:1 减去冗余次数除以题数。

事实一致:衡量查询过程中是否漂移或编造事实。计算:1 减去漂移次数除以(题数乘 3)。

查询语法:衡量生成的 SQL、Cypher 能不能执行。计算:语法正确的查询占总查询的比例。

数值准确:衡量最终答案里的数字是否命中标准答案。计算:答案中命中的关键短句占总短句的比例,数字按容差比较。

库表定位:衡量是否选对数据库和表。计算:选对库表的题占总题的比例。

字段解析:衡量表名、字段名是否真实存在,术语是否映射正确。计算:期望列名和模式在查询中的命中率。

维度(连续追问)

事实命中:衡量连续追问每一轮说出的数字和事实是否与标准答案一致。计算:命中的事实条数除以总条数,数值按容差比,文本按是否包含。

跨轮复用:衡量后续轮是否复用了前几轮确认过的表和字段。计算:期望复用的表和字段在查询中出现的比例。

防重复探索:衡量是否避免重复的基础探索。计算:1 减去重复探索次数除以轮数。

防重复查询:衡量是否避免重复执行相同的查询。计算:1 减去重复查询次数除以轮数。

抗陷阱:衡量是否被前几轮的无关结果带偏。计算:1 减去陷阱命中次数除以轮数。

字段复用:衡量字段层面的跨轮复用。计算:按期望字段的缺失比例折算。

补救收敛:衡量答错后补充提示能不能把答案拉回来。计算:首答全对得 1,补救一次全对得 0.6,补救两次全对得 0.3,仍错得 0,按轮取平均。

单题指标

平均探索轮次:衡量每道题平均探索多少轮。计算:所有题的实际轮数取平均,越低越好。

有效回答率:衡量整体答题质量。计算:完全正确加部分正确的题数除以已评分的题数。

完全正确率:衡量拿到满分的比例。计算:完全正确的题数除以已评分的题数。

事实漂移:衡量过程中编造或前后不一致的次数。计算:统计各轮查询中实体名与已确认事实的差异次数。

平均耗时:衡量端到端回答时长。计算:所有题的耗时取平均,越低越好。

总 Token:衡量整次评测的模型调用成本。计算:所有题的所有 LLM 调用的 token 求和。

平均 Token 每题:衡量单题平均成本。计算:总 token 除以题数。

对比指标

变化(百分点):衡量两个方案的差距。计算:方案 B 的数值减去方案 A,按百分点显示,带星号表示差距明显。

术语字段解析率:衡量本体敏感题里查询是否用到了正确的列名。计算:命中期望列或模式的题占比。

追问轮次得分:衡量连续追问每轮的最终得分。计算:按首答对 1、补救一次 0.6、补救两次 0.3、仍错 0,取平均。

追问总 Token、总耗时:衡量连续追问评测的总成本和总时间。计算:各会话分别求和。