组合对比报告

以单模型测试报告数据为输入,对比两个解决方案的三模块水平
① 三模块水平对比
同一批题,两个方案分别作答;这张图把它们的编排、本体、执行三项水平并排摆在一起。柱子一高一低,就是两个方案在对应能力上的差距,带星标的是差距明显、值得注意的项目。
② 差异解读
不只看差距大小,这里用大白话说明差距意味着什么:谁在哪项能力上更强、强多少、大概是什么原因。读完这一段,选哪个方案心里就有数了。
②b 本体增量:本体敏感题组对比
③ 维度级 A/B 对比
把三个模块的水平差拆到最细一层:每个具体维度上,方案 A 和方案 B 各得几分、差多少。差距究竟出在哪个环节,这张表指得最准。
④ 指标级 A/B 对比
回到原始数字看差距:轮次、正确率、耗时这些硬指标,两个方案各是多少。变化最大的排在最上面,本次对比最值得关注的项目一眼就能看到。
指标说明

模块水平

编排水平:衡量 Agent 编排流程的整体水平,包括 PDCA 循环组织、收手条件、规则执行。计算:它主导的维度分取平均,再按单题占六成、连续追问占四成合成。

本体水平:衡量 Neo4j 本体(场景定义、术语、数据映射)给查询带来的整体价值。计算方式同上;小境没有本体,此项显示"无本体"。

执行水平:衡量底层大模型生成查询和答案的整体水平。计算方式同上。

维度(单题)

探索效率:衡量实际探索轮数是否接近理想轮数。计算:1 减去(实际轮数与期望轮数之差除以 5),折算成百分数。

回答完整性:衡量一道题有多个子问题时是否逐一回应。计算:回答覆盖的子问题数占总子问题数的比例。

冗余控制:衡量是否反复做相同的探索。计算:1 减去冗余次数除以题数。

事实一致:衡量查询过程中是否漂移或编造事实。计算:1 减去漂移次数除以(题数乘 3)。

查询语法:衡量生成的 SQL、Cypher 能不能执行。计算:语法正确的查询占总查询的比例。

数值准确:衡量最终答案里的数字是否命中标准答案。计算:答案中命中的关键短句占总短句的比例,数字按容差比较。

库表定位:衡量是否选对数据库和表。计算:选对库表的题占总题的比例。

字段解析:衡量表名、字段名是否真实存在,术语是否映射正确。计算:期望列名和模式在查询中的命中率。

维度(连续追问)

事实命中:衡量连续追问每一轮说出的数字和事实是否与标准答案一致。计算:命中的事实条数除以总条数,数值按容差比,文本按是否包含。

跨轮复用:衡量后续轮是否复用了前几轮确认过的表和字段。计算:期望复用的表和字段在查询中出现的比例。

防重复探索:衡量是否避免重复的基础探索。计算:1 减去重复探索次数除以轮数。

防重复查询:衡量是否避免重复执行相同的查询。计算:1 减去重复查询次数除以轮数。

抗陷阱:衡量是否被前几轮的无关结果带偏。计算:1 减去陷阱命中次数除以轮数。

字段复用:衡量字段层面的跨轮复用。计算:按期望字段的缺失比例折算。

补救收敛:衡量答错后补充提示能不能把答案拉回来。计算:首答全对得 1,补救一次全对得 0.6,补救两次全对得 0.3,仍错得 0,按轮取平均。

单题指标

平均探索轮次:衡量每道题平均探索多少轮。计算:所有题的实际轮数取平均,越低越好。

有效回答率:衡量整体答题质量。计算:完全正确加部分正确的题数除以已评分的题数。

完全正确率:衡量拿到满分的比例。计算:完全正确的题数除以已评分的题数。

事实漂移:衡量过程中编造或前后不一致的次数。计算:统计各轮查询中实体名与已确认事实的差异次数。

平均耗时:衡量端到端回答时长。计算:所有题的耗时取平均,越低越好。

总 Token:衡量整次评测的模型调用成本。计算:所有题的所有 LLM 调用的 token 求和。

平均 Token 每题:衡量单题平均成本。计算:总 token 除以题数。

对比指标

变化(百分点):衡量两个方案的差距。计算:方案 B 的数值减去方案 A,按百分点显示,带星号表示差距明显。

术语字段解析率:衡量本体敏感题里查询是否用到了正确的列名。计算:命中期望列或模式的题占比。

追问轮次得分:衡量连续追问每轮的最终得分。计算:按首答对 1、补救一次 0.6、补救两次 0.3、仍错 0,取平均。

追问总 Token、总耗时:衡量连续追问评测的总成本和总时间。计算:各会话分别求和。