Skip to content

Latest commit

 

History

History
346 lines (251 loc) · 14.3 KB

File metadata and controls

346 lines (251 loc) · 14.3 KB

AI 驱动的个人造价数据库:产品需求文档

项目 内容
文档版本 V0.1
文档状态 初稿,待真实数据验证
目标用户 单人工程造价师
主要使用地区 西安
部署方式 单人、本地运行

1. 产品背景

用户长期积累了大量以 Excel 报表形式保存的工程造价数据,数据来自广联达、斯维尔、宏业及自制表格。单个项目通常包含清单计价表、综合单价分析表、工料机汇总表、措施项目表等多份文件。

当前数据分散在不同项目和不同格式的 Excel 中,查找历史价格、比较相似清单、追溯综合单价组成以及复用历史经验需要大量人工翻阅。随着项目数量增加,已有数据难以形成可持续积累的个人知识资产。

2. 产品目标

建设一个 AI 驱动、在本地运行的个人造价数据库,将分散的历史 Excel 转化为可检索、可比较、可追溯、可复用的结构化造价数据。

第一版优先解决以下问题:

  1. 快速找回历史项目中的清单、定额、工料机及价格数据。
  2. 比较相似项目和相似清单项的综合单价及其组成。
  3. 为新项目清单逐项匹配历史参考数据和参考价。
  4. 自动计算常用项目指标,并给出明确的数据来源和计算过程。
  5. 通过用户确认持续积累个人分类、匹配和修正规则。

3. 非目标

第一版暂不包含以下能力:

  • 自动完成整份预算或直接生成可交付的最终造价成果。
  • 自动修改或覆盖原始 Excel。
  • 在未经用户确认的情况下,将 AI 推断结果写成正式价格。
  • 多人账号、组织权限、审批流和协同编辑。
  • 同时兼容所有历史 Excel 变体。
  • 将港式清单与国内清单或香港地区价格强行等同。

4. 用户与使用环境

4.1 用户角色

第一版只有一个用户角色:数据库所有者,即个人工程造价师。

4.2 使用环境

  • 单人使用。
  • 在个人电脑本地运行,通过浏览器访问。
  • 原始 Excel、结构化数据库、匹配规则及项目资料均保存在本地。
  • AI 任务可以调用云端模型,但只发送完成任务所需的数据片段。
  • 系统记录向云端模型发送的数据范围,并支持隐藏项目名称等敏感字段。
  • 数据库、规则和原始文件应支持整体备份与恢复。

5. 现有数据概况

来源 规模估算 第一版优先级
广联达导出 Excel 约 200 个项目 最高,首批适配
自制 Excel 约 100 份 第二阶段,通过字段映射逐步适配
斯维尔导出 Excel 约 50 个项目 后续适配
宏业导出 Excel 约 30 个项目 后续适配

每个项目可能包含多份 Excel,典型报表包括:

  • 清单计价表
  • 综合单价分析表
  • 人工、材料、机械汇总表
  • 定额子目及消耗量表
  • 措施项目表
  • 取费或费用汇总表

6. 核心数据范围

系统最终需要管理以下数据:

  1. 清单项目的综合单价及组成。
  2. 人工、材料、机械价格。
  3. 定额子目及消耗量。
  4. 港式清单的项目描述和单价。
  5. 单方造价、含量等项目指标。
  6. 措施费、取费标准和费率。
  7. 可供整体检索和对比的历史项目案例。

数据建设顺序为:

  1. 基础数据层:人工、材料、机械、定额子目和消耗量。
  2. 组价数据层:清单项目、项目特征、综合单价及其组成。
  3. 项目数据层:措施费、取费标准、项目费用和指标。
  4. 案例数据层:整份历史项目及相似项目对比。
  5. 扩展数据层:港式清单描述理解、匹配与价格参考。

7. 项目元数据

导入时应记录以下项目背景信息,用于检索和价格可比性判断:

字段 要求 说明
项目名称 必填 可在调用云端 AI 前匿名化
地区 必填 第一版主要为西安
计价时间或价格基准期 必填 用于时间维度比较
专业 必填 如土建、装饰、安装、市政
计价模式与定额版本 必填 国内清单、港式清单等
成果阶段 必填 概算、预算、控制价、投标价、结算价等
项目类型 选填 住宅、商业、办公、工业等
建筑面积或规模 选填但建议填写 用于项目指标计算
建设性质 选填 新建、改造、维修等
数据来源 自动记录 文件、工作表及导入批次
可信程度 可维护 正式稿、过程稿、作废稿等

“项目地区”和“计价体系”必须分别记录。内地项目可以采用港式清单,不能因此被识别为香港项目,也不能直接套用香港地区价格。

8. 核心业务流程

8.1 历史项目导入

  1. 用户选择一个项目文件夹或一批项目文件夹。
  2. 系统根据表头和内容识别报表类型,不依赖固定文件名。
  3. 系统提取项目、清单、定额、综合单价组成、工料机和措施费数据。
  4. 系统利用编码、层级位置及其他稳定字段建立报表之间的关联。
  5. 用户确认项目元数据和报表识别结果。
  6. 系统生成导入质量报告,只要求用户处理异常项。
  7. 用户修正的模板识别规则被保存,并用于后续同类文件。
  8. 原始 Excel 永久保留,任何结构化数据都可追溯到源文件。

首批迁移先选择 5 至 10 个有代表性的广联达项目验证规则。准确性达到要求后,再批量扫描其余项目并集中处理异常。

8.2 历史数据查询

系统同时提供两种查询入口:

  • 结构化筛选:按地区、时间、专业、项目类型、单位、价格区间等条件过滤。
  • AI 对话:使用自然语言查询,例如“找出近三年西安住宅项目中 C30 商品混凝土的价格和来源”。

查询结果应包含:

  • 原始名称、编码、规格、单位和价格。
  • 所属项目及项目背景。
  • 原始文件、工作表、对应行或单元格等来源信息。
  • 样本数量、价格区间、中位数等统计结果。
  • 数据是原始值、系统计算值还是 AI 推断值的明确标识。

8.3 新项目清单参考价匹配

  1. 用户上传一份新项目清单。
  2. 系统识别项目特征、清单项、项目描述、规格和单位。
  3. 系统从历史数据库中检索相似清单项和相似项目。
  4. 系统给出候选参考价、匹配程度和匹配理由。
  5. 用户逐项确认、调整或拒绝推荐结果。
  6. 系统导出参考价分析表。

该结果仅作为参考依据,不自动成为最终组价或正式成果。

8.4 综合单价对比

用户可以选择多个相似清单项,查看并比较:

  • 综合单价及价格分布。
  • 人工费、材料费、机械费。
  • 管理费、利润、风险及其他组成。
  • 关联定额子目、消耗量和主要材料价格。
  • 项目地区、时间、计价口径等背景差异。
  • 异常高价、低价和明显口径差异。

8.5 项目指标计算

第一版优先自动计算:

  • 单方造价 = 总造价 ÷ 建筑面积。
  • 钢筋含量 = 钢筋工程量 ÷ 建筑面积。
  • 混凝土含量 = 混凝土工程量 ÷ 建筑面积。

系统计算值是主要结果,Excel 中已有指标可作为校验值。每项指标必须展示公式、分子来源、分母口径和数据范围。读取值与计算值差异超过设定阈值时,应提示用户核查。

9. 数据标准化与匹配原则

9.1 原始数据保护

  • 完整保留原始名称、编码、项目特征、单位和价格。
  • 标准化结果不得覆盖原始值。
  • 所有修改只作用于结构化副本、映射关系或个人规则。

9.2 相似项归类

  • AI 可以识别“预拌混凝土 C30”“商品砼 C30”等可能相同的表达。
  • 系统分别提取强度、材质、规格、施工方式等关键属性。
  • AI 提供标准名称和候选归类,由用户首次确认。
  • 确认结果形成个人规则,后续自动应用。
  • 匹配不确定时并列展示候选项,不擅自合并。

9.3 分类体系

系统采用双层分类:

  • 原始分类:保留清单编码、定额编码、专业章节等官方或软件分类。
  • 个人分类:按照用户的成本分析习惯建立专业和成本类别。

AI 可以提出个人分类建议,但最终分类规则由用户确认。同一条数据可同时属于原始分类和个人分类。

9.4 单位与口径

系统应识别同义单位和可换算单位,但只有换算依据明确时才自动转换。规格、工作内容或计量规则不同的数据不能仅因单位相同而合并。

10. 价格比较原则

跨项目比较同时展示两套价格:

  • 原始价:历史 Excel 中的原始价格,用于追溯和核查。
  • 可比价:根据时间、地区、税率及计价口径进行换算,用于横向比较。

任何可比价必须展示:

  • 换算依据及来源。
  • 使用的公式和参数。
  • 原始值与换算结果。
  • 换算时间和适用范围。

缺少可靠依据时,系统只提示存在差异,不自动换算。AI 推算价格不得显示为原始价格。

11. 版本、重复与追溯

  • 系统根据项目身份及文件内容识别重复导入。
  • 完全相同的文件直接跳过。
  • 文件内容变化时创建新版本,不覆盖旧版本。
  • 查询默认使用最新的有效版本。
  • 用户可以查看不同版本之间的差异。
  • 版本可标记为正式稿、过程稿或作废稿。
  • 每条结构化记录可追溯至项目、文件、工作表、行或单元格及导入批次。

12. 导入质量控制

每次导入应生成质量报告,至少包含:

  • 已识别和未识别的文件及工作表。
  • 关键字段缺失情况。
  • 单位、编码和数据类型冲突。
  • 清单与综合单价分析关联失败项。
  • 定额与工料机关联失败项。
  • 疑似重复数据。
  • 金额汇总不平或组成金额异常。
  • 需要人工确认的低置信度结果。

系统应优先让用户处理异常,而不是要求逐行确认全部数据。

13. AI 能力与约束

13.1 AI 负责的工作

  • 识别结构不完全一致的 Excel 报表。
  • 理解清单描述,提取关键规格和工作内容。
  • 推荐相似清单、材料、定额及历史项目。
  • 提议标准名称、个人分类和匹配关系。
  • 解释价格差异和异常数据。
  • 通过自然语言查询数据库并生成分析摘要。

13.2 AI 不得自行决定的工作

  • 覆盖或删除原始数据。
  • 将不确定的匹配自动确认为同一数据。
  • 在缺少依据时生成精确可比价。
  • 将推断结果伪装成历史原始数据。
  • 未经用户确认生成可直接交付的最终预算成果。

13.3 可信度表达

AI 结果应包含匹配程度、依据和不确定点。低可信度结果必须要求用户确认,用户修正应沉淀为可查看、可修改、可删除的个人规则。

14. 数据安全与备份

  • 原始文件和数据库默认只保存在本地。
  • 云端 AI 只接收当前任务必要的数据片段。
  • 系统应支持发送前预览或记录发送内容。
  • API 密钥等凭据不得写入项目数据或导出文件。
  • 支持数据库、原始文件、配置和个人规则的整体备份。
  • 支持从备份恢复,并校验备份完整性。

15. 第一版功能范围

15.1 必须具备

  • 广联达标准 Excel 报表导入。
  • 项目文件夹批量识别。
  • 项目元数据维护。
  • 清单、综合单价组成、定额和工料机的结构化关联。
  • 导入质量报告和异常复核。
  • 原始文件追溯和版本管理。
  • 条件筛选与自然语言查询。
  • 相似清单及历史参考价匹配。
  • 综合单价组成对比。
  • 新项目清单逐项匹配与确认。
  • 参考价分析表导出。
  • 三项核心项目指标自动计算。
  • 用户确认规则的持续积累。
  • 本地备份与恢复。

15.2 后续版本

  • 自制 Excel 字段映射和模板管理。
  • 斯维尔和宏业报表适配。
  • 更多项目指标和个人指标模板。
  • 更多造价信息价、价格指数和调价依据接入。
  • 更完整的港式清单专用分析能力。
  • 多设备或个人服务器部署。
  • 团队协作和权限体系。

16. 初步验收标准

第一版是否可用,建议至少满足以下标准:

  1. 代表性广联达样本能够完成批量导入,且不修改原始文件。
  2. 清单、综合单价组成、定额和工料机之间的关键关联结果可人工核查。
  3. 任意查询结果可以回到对应的原始项目和 Excel 位置。
  4. 相同文件重复导入不会产生重复有效数据。
  5. 更新后的文件形成新版本,旧版本仍可查看。
  6. 用户可以用条件筛选和自然语言找到指定历史清单及价格。
  7. 系统可以为新清单提供多个候选历史参考项、匹配理由和来源。
  8. 原始价与可比价明确区分,可比价展示完整换算依据。
  9. 单方造价、钢筋含量和混凝土含量可以自动计算并追溯数据来源。
  10. 用户对匹配或分类的修正可以在后续同类数据中复用。
  11. 数据可以完整备份并恢复,恢复后来源关系和版本记录不丢失。

具体字段识别率、关联准确率和查询响应时间,需要在样本数据验证后设定量化指标。

17. 待确认问题

以下问题尚未在首轮访谈中确定:

  1. 广联达报表的具体版本、典型模板及字段差异。
  2. 西安项目采用的主要陕西定额版本和计价依据。
  3. 项目正式稿、过程稿和作废稿的现有识别方式。
  4. 个人成本科目或分类表是否已经存在。
  5. 可比价所采用的信息价来源、价格指数、税率和调价方法。
  6. 新项目清单的常见格式以及最终导出模板。
  7. 建筑面积、地上面积、地下面积等指标分母的具体口径。
  8. 综合单价组成在不同计价软件或不同项目中的统一口径。
  9. 数据备份位置、频率及保留周期。
  10. 云端 AI 供应商、模型选择、成本上限及数据保留政策。

18. 下一步建议

  1. 收集 5 至 10 个结构和年代有差异的广联达项目样本。
  2. 为每类报表选取脱敏样例,盘点工作表、表头、合并单元格和层级结构。
  3. 建立第一版数据字典和报表之间的关联规则。
  4. 用样本验证导入质量、追溯粒度和指标计算口径。
  5. 基于验证结果补充量化验收标准,再进入原型设计和技术方案阶段。