CASE STUDY02

AI APPLICATION

Enterprise AI Ticket Copilot

面向企业工单处理场景的 AI 应用,串联知识检索、建议生成、人工复核、Trace 和审计流程。

MY ROLE / AI COLLABORATION

我负责项目方向、RAG 边界、验收标准、评测口径与证据核验;Codex/Claude 深度参与实现、测试和文档,不把 AI 生成代码包装为独立手写。

STACK

Java 17 · Spring Boot 3 · Vue 3 · TypeScript · Keyword Retrieval · Human Review · Trace

STATUS

CI VERIFIED

REAL LOCAL RUN / REPOSITORY EVIDENCE02
Enterprise Ticket RAG Copilot 工单工作台真实运行页面VIEW ORIGINAL · Enterprise AI Ticket Copilot 真实运行截图
REAL RUN SCREENSHOTEnterprise AI Ticket Copilot

画面来自项目仓库保存的真实本地运行截图,不是概念图或第三方产品截图。

100% 命中率, 不等于检索已经完美。

普通 RAG Demo 往往只展示一个问答框,却无法回答建议引用了什么、哪些样本召回失败,以及风险动作由谁确认。本案例把失败样本和人工门禁放到成功指标旁边。

从检索证据到人工门禁的决策链路。

  1. 01Ticket Input
  2. 02Query Rewrite
  3. 03Keyword Retrieval
  4. 04Citation Evidence
  5. 05Citation Gating
  6. 06Provider 或 local-rule fallback
  7. 07Answer Draft
  8. 08Human Review

把引用质量与失败样本一起展示。

01

先建立 keyword retrieval baseline

关键词检索易复现、易检查,可先暴露数据集、召回与引用问题。

未选择 / 取舍
未把 Vector DB、Hybrid Retrieval 或 Rerank 写成已实现;它们保留为后续实验方向。
失败验证
EVAL-016 因“登录”相似词额外召回账号知识,直接暴露 baseline 的分类与 rerank 缺口。
02

Citation gating 是回答前提

引用来源被显式验证并展示;证据不足时进入 fallback 或 review。

未选择 / 取舍
Citation Coverage 只能证明回答附带了来源,不能证明来源相关、完整或答案正确。
失败验证
Citation Precision 仅 81.11%,证明“有引用”与“引用准确”必须分开。
03

高风险建议进入 Human Review

Answer Draft 不会自动对外发送,Approve、Request Changes 与 Reject 构成显式门禁。

未选择 / 取舍
多一道人工确认会增加处理时间,但避免把低证据建议直接变成外部动作。
失败验证
16 条 synthetic cases 中 15 条触发 Human Review Required;测试验证 review 状态流。
04

无 API Key 时明确使用 local-rule

本次评测没有配置真实 Provider Key,Provider 路径记录为 local-rule fallback。

未选择 / 取舍
默认可运行与可复现优先于伪造外部模型调用;因此不评估真实模型生成质量。
失败验证
Provider fallback 100% 只表示本次没有真实 Key,不是模型成功率或质量指标。
05

100% Hit Rate 与 90% Recall 并列

Top-K Hit Rate 表示至少命中一个预期来源,Context Recall@3 才反映预期来源是否完整覆盖。

未选择 / 取舍
未只展示最漂亮的 100%;同时展示 90% Recall、81.11% Precision 和失败样本。
失败验证
EVAL-007、015、016 等样本说明命中并不等于上下文干净或完整。
06

失败样本进入下一轮检索实验

每个 failed case 保留 expected、observed 与 reason,作为分类、阈值和 rerank 的实验输入。

未选择 / 取舍
未用人工改写结果掩盖失败;代价是公开指标不全为 100%。
失败验证
当前 16 条 synthetic cases 中有 6 条 failed cases,页面详细展示 EVAL-015 与 EVAL-016。

成功结果只说明正常路径;失败结果用于检查设计是否真的守住边界。

其他失败回放

  • EVAL-016“登录”词触发账号知识误命中
    EXPECTED
    召回 API 500 与运维排查知识。
    OBSERVED
    额外召回 KB-ACCOUNT-001。
    LESSON / BOUNDARY
    keyword baseline 需要更好的意图分类、字段权重或 rerank。 不把该样本外推为真实企业工单分布。
  • EVAL-007预期端口知识旁混入运维与 Bean 来源
    EXPECTED
    聚焦 Java 端口冲突知识。
    OBSERVED
    同时召回 KB-OPS-003 与 KB-SPRING-BEAN。
    LESSON / BOUNDARY
    Top-K 命中不代表上下文没有噪声。 辅助失败样本,只用于解释 Citation Precision。

合成评测、失败样本与审核门禁。

01 / synthetic-evaluation16 SYNTHETIC CASES

自建 demo dataset · 不包含真实用户数据

2026-07-31 · 不代表真实企业工单分布或线上模型效果。评测数据与计划
02 / synthetic-evaluationTOP-K HIT 100% / RECALL@3 90%

keyword retrieval baseline · Top-K = 3

2026-07-31 · 至少命中一个预期来源,不代表召回完整或答案正确。最新指标 JSON
03 / synthetic-evaluationCOVERAGE 100% / PRECISION 81.11%

citation-gated local evaluation

2026-07-31 · 有引用不等于引用相关、完整或回答正确。评测指标快照
04 / synthetic-evaluation6 FAILED / 15 REVIEW REQUIRED

16 条 synthetic cases 的失败与门禁结果

2026-07-31 · 失败与审核数量只适用于该固定数据集。最新评测结果
05 / documentationPROVIDER FALLBACK 100%

本次未配置真实 API Key · local-rule fallback

2026-07-31 · 这是配置路径结果,不是模型质量或成功率指标。Provider 路径说明
SECONDARY VIEW / TRACEABLE UI05B
Enterprise Ticket RAG Copilot Trace Timeline 真实运行页面VIEW ORIGINAL · Enterprise AI Ticket Copilot 真实运行截图
REAL RUN SCREENSHOTEnterprise AI Ticket Copilot
METRICS / BASELINE EVIDENCE05C
Enterprise Ticket RAG Copilot 本地合成评测指标页面VIEW ORIGINAL · Enterprise AI Ticket Copilot 真实运行截图
REAL RUN SCREENSHOTEnterprise AI Ticket Copilot

不把 Demo, 包装成生产系统。

  • 默认数据集为 16 条 synthetic enterprise ticket demo cases。
  • 默认检索方式是 keyword retrieval,不声称已经实现向量数据库、Hybrid Retrieval 或 Rerank。
  • Provider fallback 100% 来自未配置真实 API Key,不是模型质量指标。
  • 100% Top-K Hit Rate 不等于检索完美;Context Recall@3 为 90%,Citation Precision 为 81.11%。
NEXT CASE / 03DevFlow Copilot