Skip to content

Latest commit

 

History

History
80 lines (59 loc) · 4.97 KB

File metadata and controls

80 lines (59 loc) · 4.97 KB

项目证据、完成度与表述边界

这份文件用于回答三个问题:仓库里什么已经实现,什么经过了真实规模验证,什么仍属于完整矿区系统的演进设计。它既是开源项目的可信度说明,也是汇报和面试时防止夸大的口径表。

1. 证据等级

等级 定义 可使用的表述
A:实现并自动验证 代码、测试、公开 fixture 和 CI 都存在 “已实现并通过自动化测试”
B:真实环境验证 在真实数据规模、真实账号或真实网络中运行并保留产物 “已在指定范围内验证”
C:原型或局部验证 有可运行链路,但性能、规模或边界尚未完整测试 “已完成原型/局部验证”
D:架构设计 有明确接口、状态和演进理由,仓库尚未实现 “下一阶段设计/计划”

2. 当前证据矩阵

能力 等级 证据 不能推出的结论
六类 Multi-Teacher 流式扫描 A/B 代码、测试、174,426 次图片-模型推理产物 Teacher 预测全部正确
GT/AUTO 四状态与多几何审核 A/B 公开 fixture、真实 30,183 条审核项 自动规则可以替代人工
源标签只读与派生数据集写回 A review-apply、漂移检查、测试 新数据一定提升 mAP
阈值校准与 Wilson 下界 A 2,400 条公开审核 fixture、报告、测试 默认阈值可迁移到所有场景
跨 Teacher 共识门控 A 一对一匹配 fixture、CI 两个模型一致就是真值
近重复与主动审核 A 合成 fixture、报告、测试 主动样本通过率等于总体精度
桌面审核器 A/B 聚合审核、日志恢复、真实审核使用 支持大规模多人并发
Web 多人审核平台 A/B Spring Boot/Vue/MySQL、双账号校园网验证 已完成高并发压测
生产规模任务迁移 B 30,183 任务、4,465 历史决定迁移 模型准确率达到某个水平
20 路 RTSP 调度 D 手册与系统设计中的有界队列方案 仓库已经完成 20 路稳定压测
RAG 安全知识库 D 证据化架构设计 已完成规程召回评测
Function Calling Agent D 工具白名单与状态机设计 已自动执行真实高风险处置
Jetson/TensorRT 部署 C/D 项目经历与部署思路,公开仓库无完整基准 公开仓库复现了 80 ms 和 90% 带宽节省

3. 已验证的真实规模事实

  • 私有六分类数据集包含 29,071 张图片。
  • 六个单类别 Teacher 共执行 174,426 次图片-模型推理。
  • 生成 99,696 条预测证据和 30,183 条人工审核项。
  • 可视化失败数为 0,源标签保持不变。
  • Web 平台导入 30,183 条任务。
  • 桌面端 4,465 条历史决定完成迁移;重复迁移保持幂等。
  • 两个独立账号在可信校园网中同时领取和审核任务。

这些数字证明流水线和协作工作流在该范围内运行过,不证明检测器在未知数据上的泛化精度,也不等于最大并发容量。

4. 模型收益如何正确证明

新标签是否有效必须使用固定、隔离、审核质量可控的测试集比较。建议同时报告:

  • 全局 Precision、Recall、mAP50、mAP50-95。
  • person、helmet、vest、tractor、slipper、smoking 的分类别指标。
  • 戴安全帽吸烟、穿拖鞋人员、远距离小目标等专项联合场景。
  • 误报/漏报案例、阈值敏感性和事件级指标。
  • 推理分辨率、模型版本、置信度/NMS 参数和硬件环境。

训练损失下降、训练集可视化变好或某几张截图成功都不能单独证明收益。

5. 简历与汇报推荐口径

可以说:

设计并实现 Multi-Teacher 半自动补标和多人审核闭环,使用六个单类别 Teacher 扫描全量数据,通过多几何量识别漏标与冲突;用 Spring Boot、Vue 和 MySQL 实现原子领任务、租约心跳、乐观版本和审计式纠错,在 30,183 条真实审核任务和双账号校园网协作中完成验证。

需要限定:

针对 20 路 RTSP 规划最新帧优先、有界队列、动态 Batch 和时序告警架构;当前公开仓库重点交付数据治理和审核平台,视频、RAG、Agent 与边缘部署按各自完成度继续演进。

不建议说:

  • “自动补标完全替代了人工”。
  • “双账号测试证明平台支持高并发”。
  • “默认阈值适用于任何 YOLO 数据集”。
  • “高置信度预测就是 Ground Truth”。
  • “单帧推理低于 80 ms,所以 20 路端到端都低于 80 ms”。

6. 下一轮证据优先级

  1. 固定测试集上的新旧六类模型对比,特别是联合场景专项集。
  2. Web 平台 5-20 并发审核员的可重复负载测试和数据库慢查询证据。
  3. 一次完整的审核决定导出、派生数据集生成、训练和回归报告。
  4. RTSP 多路端到端延迟分解:捕获、排队、推理、事件、展示。
  5. RAG 引用正确率、拒答率和高风险人工升级率。