CASE STUDY02
AI APPLICATION
Enterprise AI Ticket Copilot
面向企业工单处理场景的 AI 应用,串联知识检索、建议生成、人工复核、Trace 和审计流程。
REAL LOCAL RUN / REPOSITORY EVIDENCE02
TICKET WORKBENCH
TICKET WORKBENCH1920 × 1200 pxVIEW ORIGINAL · Enterprise AI Ticket Copilot 真实运行截图 →画面来自项目仓库保存的真实本地运行截图,不是概念图或第三方产品截图。
/ PROBLEM & OWNERSHIP
100% 命中率,
不等于检索已经完美。
普通 RAG Demo 往往只展示一个问答框,却无法回答建议引用了什么、哪些样本召回失败,以及风险动作由谁确认。本案例把失败样本和人工门禁放到成功指标旁边。
/ SYSTEM PATH
从检索证据到人工门禁的决策链路。
- 01Ticket Input
- 02Query Rewrite
- 03Keyword Retrieval
- 04Citation Evidence
- 05Citation Gating
- 06Provider 或 local-rule fallback
- 07Answer Draft
- 08Human Review
/ DECISIONS & FAILURE CHECKS
把引用质量与失败样本一起展示。
01先建立 keyword retrieval baseline
关键词检索易复现、易检查,可先暴露数据集、召回与引用问题。
+
- 未选择 / 取舍
- 未把 Vector DB、Hybrid Retrieval 或 Rerank 写成已实现;它们保留为后续实验方向。
- 失败验证
- EVAL-016 因“登录”相似词额外召回账号知识,直接暴露 baseline 的分类与 rerank 缺口。
02Citation gating 是回答前提
引用来源被显式验证并展示;证据不足时进入 fallback 或 review。
+
- 未选择 / 取舍
- Citation Coverage 只能证明回答附带了来源,不能证明来源相关、完整或答案正确。
- 失败验证
- Citation Precision 仅 81.11%,证明“有引用”与“引用准确”必须分开。
03高风险建议进入 Human Review
Answer Draft 不会自动对外发送,Approve、Request Changes 与 Reject 构成显式门禁。
+
- 未选择 / 取舍
- 多一道人工确认会增加处理时间,但避免把低证据建议直接变成外部动作。
- 失败验证
- 16 条 synthetic cases 中 15 条触发 Human Review Required;测试验证 review 状态流。
04无 API Key 时明确使用 local-rule
本次评测没有配置真实 Provider Key,Provider 路径记录为 local-rule fallback。
+
- 未选择 / 取舍
- 默认可运行与可复现优先于伪造外部模型调用;因此不评估真实模型生成质量。
- 失败验证
- Provider fallback 100% 只表示本次没有真实 Key,不是模型成功率或质量指标。
05100% Hit Rate 与 90% Recall 并列
Top-K Hit Rate 表示至少命中一个预期来源,Context Recall@3 才反映预期来源是否完整覆盖。
+
- 未选择 / 取舍
- 未只展示最漂亮的 100%;同时展示 90% Recall、81.11% Precision 和失败样本。
- 失败验证
- EVAL-007、015、016 等样本说明命中并不等于上下文干净或完整。
06失败样本进入下一轮检索实验
每个 failed case 保留 expected、observed 与 reason,作为分类、阈值和 rerank 的实验输入。
+
- 未选择 / 取舍
- 未用人工改写结果掩盖失败;代价是公开指标不全为 100%。
- 失败验证
- 当前 16 条 synthetic cases 中有 6 条 failed cases,页面详细展示 EVAL-015 与 EVAL-016。
/ FEATURED FAILURE CASE
成功结果只说明正常路径;失败结果用于检查设计是否真的守住边界。
PRIMARY · EVAL-015
缺少知识时仍召回无关来源
- SETUP
- 该 synthetic case 预期没有可用知识来源。
- EXPECTED
- 不引用知识条目,进入 fallback / review。
- OBSERVED
- 实际召回 KB-FAQ-KNOWLEDGE,失败原因为 unexpected_retrieval_for_fallback_case。
- LESSON
- 关键词重叠会让系统在缺知识时仍显得“有证据”;需要 no-answer threshold、分类或 rerank。
BOUNDARY这是自建 synthetic demo case,只说明当前本地 baseline 的召回边界。
其他失败回放
EVAL-016“登录”词触发账号知识误命中+
- EXPECTED
- 召回 API 500 与运维排查知识。
- OBSERVED
- 额外召回 KB-ACCOUNT-001。
- LESSON / BOUNDARY
- keyword baseline 需要更好的意图分类、字段权重或 rerank。 不把该样本外推为真实企业工单分布。
EVAL-007预期端口知识旁混入运维与 Bean 来源+
- EXPECTED
- 聚焦 Java 端口冲突知识。
- OBSERVED
- 同时召回 KB-OPS-003 与 KB-SPRING-BEAN。
- LESSON / BOUNDARY
- Top-K 命中不代表上下文没有噪声。 辅助失败样本,只用于解释 Citation Precision。
/ VERIFIED EVIDENCE
合成评测、失败样本与审核门禁。
01 / synthetic-evaluation16 SYNTHETIC CASES自建 demo dataset · 不包含真实用户数据
2026-07-31 · 不代表真实企业工单分布或线上模型效果。评测数据与计划 ↗02 / synthetic-evaluationTOP-K HIT 100% / RECALL@3 90%keyword retrieval baseline · Top-K = 3
2026-07-31 · 至少命中一个预期来源,不代表召回完整或答案正确。最新指标 JSON ↗03 / synthetic-evaluationCOVERAGE 100% / PRECISION 81.11%citation-gated local evaluation
2026-07-31 · 有引用不等于引用相关、完整或回答正确。评测指标快照 ↗04 / synthetic-evaluation6 FAILED / 15 REVIEW REQUIRED16 条 synthetic cases 的失败与门禁结果
2026-07-31 · 失败与审核数量只适用于该固定数据集。最新评测结果 ↗05 / documentationPROVIDER FALLBACK 100%本次未配置真实 API Key · local-rule fallback
2026-07-31 · 这是配置路径结果,不是模型质量或成功率指标。Provider 路径说明 ↗ / SOURCE INDEX
每个入口都固定到对应仓库与证据提交;链接说明打开的具体内容。
/ HONEST BOUNDARIES
不把 Demo,
包装成生产系统。
- 默认数据集为 16 条 synthetic enterprise ticket demo cases。
- 默认检索方式是 keyword retrieval,不声称已经实现向量数据库、Hybrid Retrieval 或 Rerank。
- Provider fallback 100% 来自未配置真实 API Key,不是模型质量指标。
- 100% Top-K Hit Rate 不等于检索完美;Context Recall@3 为 90%,Citation Precision 为 81.11%。
NEXT CASE / 03DevFlow Copilot↗