本案例来自一次私有六分类全量运行,但不公开图片、模型权重、本机路径或数据集名称。目的不是披露业务数据,而是证明人工门控并非只在公开合成样例上运行,而是已经接受生产规模证据流验证。
| 项目 | 结果 |
|---|---|
| 数据集图片 | 29,071 |
| 单类别 Teacher | 6 |
| 图片-模型推理次数 | 174,426 |
| 原始预测证据行 | 99,696 |
| 进入人工审核的行 | 30,183 |
| 可视化失败 | 0 |
| 是否修改源标签 | 否 |
| 快照时已完成人工决策 | 0 |
扫描在 CUDA FP16 下以 832 输入尺寸、batch=32 运行,每次只让一个 Teacher 驻留显存,并对 train、val、test 三个划分执行六类全量检测。
| 终态分组 | 数量 | 审核队列占比 | 处理方式 |
|---|---|---|---|
| 训练集疑似漏标 | 18,120 | 60.03% | 人工决定新增或拒绝 |
| 评测集疑似漏标 | 7,951 | 26.34% | 默认禁止写入训练标签 |
| 同目标框尺度冲突 | 3,688 | 12.22% | 替换或拒绝,禁止追加第二个框 |
| 跨类别冲突 | 424 | 1.41% | 人工进行语义判断 |
生成审核队列前,系统已识别并保留审计记录但不要求人工处理:已有标签预测 60,563 条、模型重复候选 2,050 条、低于审核阈值 6,900 条,共减少 69,513 条无效审核工作。
| 类别 | 审核数量 | 占比 |
|---|---|---|
| person | 25,066 | 83.05% |
| helmet | 1,823 | 6.04% |
| smoking | 1,265 | 4.19% |
| vest | 1,031 | 3.42% |
| slipper | 886 | 2.94% |
| tractor | 112 | 0.37% |
person 占据绝大多数审核工作。这说明“完整枚举在技术上正确”不等于“人工成本可接受”。下一轮应结合分类别审核预算或依据真实审核结果校准 person 策略,而不是简单提高全局阈值。
- 安全帽、背心和拖鞋候选中存在明确的可信漏标。
- 吸烟高置信候选中出现了“嘴边话筒”等困难反例,直接证明高置信度只能代表证据强度,不能自动获得写标签权限。
- 同目标框尺度冲突达到
3,688条,仅使用 IoU 后直接追加会制造有害重复 GT。 - val/test 疑似漏标共
7,951条,默认冻结可以防止数据修复过程悄悄改变评测标准。 - 全部审核图均成功生成,可将审核包直接交给不具备 GPU 环境的标注团队。
GitHub 仅发布聚合后的脱敏证据。私有运行的 manifest、阈值策略、原始 CSV、审核包和图片继续保存在本地;仓库中不提交任何私有图片、标签、权重、主机名或文件系统路径。