这份文件用于回答三个问题:仓库里什么已经实现,什么经过了真实规模验证,什么仍属于完整矿区系统的演进设计。它既是开源项目的可信度说明,也是汇报和面试时防止夸大的口径表。
| 等级 | 定义 | 可使用的表述 |
|---|---|---|
| A:实现并自动验证 | 代码、测试、公开 fixture 和 CI 都存在 | “已实现并通过自动化测试” |
| B:真实环境验证 | 在真实数据规模、真实账号或真实网络中运行并保留产物 | “已在指定范围内验证” |
| C:原型或局部验证 | 有可运行链路,但性能、规模或边界尚未完整测试 | “已完成原型/局部验证” |
| D:架构设计 | 有明确接口、状态和演进理由,仓库尚未实现 | “下一阶段设计/计划” |
| 能力 | 等级 | 证据 | 不能推出的结论 |
|---|---|---|---|
| 六类 Multi-Teacher 流式扫描 | A/B | 代码、测试、174,426 次图片-模型推理产物 | Teacher 预测全部正确 |
| GT/AUTO 四状态与多几何审核 | A/B | 公开 fixture、真实 30,183 条审核项 | 自动规则可以替代人工 |
| 源标签只读与派生数据集写回 | A | review-apply、漂移检查、测试 | 新数据一定提升 mAP |
| 阈值校准与 Wilson 下界 | A | 2,400 条公开审核 fixture、报告、测试 | 默认阈值可迁移到所有场景 |
| 跨 Teacher 共识门控 | A | 一对一匹配 fixture、CI | 两个模型一致就是真值 |
| 近重复与主动审核 | A | 合成 fixture、报告、测试 | 主动样本通过率等于总体精度 |
| 桌面审核器 | A/B | 聚合审核、日志恢复、真实审核使用 | 支持大规模多人并发 |
| Web 多人审核平台 | A/B | Spring Boot/Vue/MySQL、双账号校园网验证 | 已完成高并发压测 |
| 生产规模任务迁移 | B | 30,183 任务、4,465 历史决定迁移 | 模型准确率达到某个水平 |
| 20 路 RTSP 调度 | D | 手册与系统设计中的有界队列方案 | 仓库已经完成 20 路稳定压测 |
| RAG 安全知识库 | D | 证据化架构设计 | 已完成规程召回评测 |
| Function Calling Agent | D | 工具白名单与状态机设计 | 已自动执行真实高风险处置 |
| Jetson/TensorRT 部署 | C/D | 项目经历与部署思路,公开仓库无完整基准 | 公开仓库复现了 80 ms 和 90% 带宽节省 |
- 私有六分类数据集包含
29,071张图片。 - 六个单类别 Teacher 共执行
174,426次图片-模型推理。 - 生成
99,696条预测证据和30,183条人工审核项。 - 可视化失败数为
0,源标签保持不变。 - Web 平台导入
30,183条任务。 - 桌面端
4,465条历史决定完成迁移;重复迁移保持幂等。 - 两个独立账号在可信校园网中同时领取和审核任务。
这些数字证明流水线和协作工作流在该范围内运行过,不证明检测器在未知数据上的泛化精度,也不等于最大并发容量。
新标签是否有效必须使用固定、隔离、审核质量可控的测试集比较。建议同时报告:
- 全局 Precision、Recall、mAP50、mAP50-95。
- person、helmet、vest、tractor、slipper、smoking 的分类别指标。
- 戴安全帽吸烟、穿拖鞋人员、远距离小目标等专项联合场景。
- 误报/漏报案例、阈值敏感性和事件级指标。
- 推理分辨率、模型版本、置信度/NMS 参数和硬件环境。
训练损失下降、训练集可视化变好或某几张截图成功都不能单独证明收益。
可以说:
设计并实现 Multi-Teacher 半自动补标和多人审核闭环,使用六个单类别 Teacher 扫描全量数据,通过多几何量识别漏标与冲突;用 Spring Boot、Vue 和 MySQL 实现原子领任务、租约心跳、乐观版本和审计式纠错,在 30,183 条真实审核任务和双账号校园网协作中完成验证。
需要限定:
针对 20 路 RTSP 规划最新帧优先、有界队列、动态 Batch 和时序告警架构;当前公开仓库重点交付数据治理和审核平台,视频、RAG、Agent 与边缘部署按各自完成度继续演进。
不建议说:
- “自动补标完全替代了人工”。
- “双账号测试证明平台支持高并发”。
- “默认阈值适用于任何 YOLO 数据集”。
- “高置信度预测就是 Ground Truth”。
- “单帧推理低于 80 ms,所以 20 路端到端都低于 80 ms”。
- 固定测试集上的新旧六类模型对比,特别是联合场景专项集。
- Web 平台 5-20 并发审核员的可重复负载测试和数据库慢查询证据。
- 一次完整的审核决定导出、派生数据集生成、训练和回归报告。
- RTSP 多路端到端延迟分解:捕获、排队、推理、事件、展示。
- RAG 引用正确率、拒答率和高风险人工升级率。