Skip to content

Latest commit

 

History

History
380 lines (259 loc) · 16.3 KB

File metadata and controls

380 lines (259 loc) · 16.3 KB

第 11 章:你的数据去哪了——隐私与数据流

本章在全书的位置:第三部分 · 第 11 章 / 预估阅读+动手时长:主线 20-25 分钟 + 支线 10 分钟

前置章节:Ch 4(Claude Code 是什么)+ Ch 7(权限机制)

学完能做什么(主线):搞清楚你发给 Claude 的文字、@ 引用的文件、! 跑的命令,它们去了哪、停留多久、会不会被人看、会不会用来训练模型。从此用 Claude Code 时心里有底。


开场三问

  • 你会遇到什么问题:工作文件里有客户名单、商业数据、个人笔记——交给 Claude 会不会泄露?公司会不会不允许用?
  • 不读这章会踩什么坑:要么过度恐慌(什么都不敢给它看)、要么完全不设防(把密码、合同一股脑塞进去)。
  • 读完你会多会什么事:能画出"一次 Claude 对话的数据流路线图",知道什么能放、什么必须脱敏、什么绝对不能放;能回答同事或老板"这个工具安全吗"。

本章地图(一眼看全貌)

---
config:
  theme: forest
  themeVariables:
    fontFamily: "-apple-system, 'SF Pro Text', 'PingFang SC', 'Helvetica Neue', sans-serif"
    fontSize: "17px"
    lineColor: "#D9D9D9"
---
mindmap
  root((第 11 章 · 你的数据去哪了))
    数据流路线图
      本地打包
      HTTPS 加密
      Anthropic 服务器
      30 天后删除
    暂存 vs 训练
      暂存 30 天
      默认不训练
      写进服务条款
    红线清单
      密钥与凭证
      他人个人信息
      公司机密与 NDA
      会传染的内容
    黄线清单
      自己的隐私
      公司可分享内容
      业务代码
    公司用户决策
      先查 AI 政策
      版本选型
      画分类边界
    本地替代方案
      开源本地模型
      混合工作流
      私有化部署
Loading

🎯 【主线】—— 本章必读核心


11.1 先看一张图:一次对话的数据去了哪

你在终端敲的每一句话,会经过下面这些环节:

 ┌─────────────────────────────────────────────────┐
 │ 你的电脑(本地)                                 │
 │                                                 │
 │  1. 你在终端打字 → Claude Code CLI 收到          │
 │  2. CLI 读取你 @ 引用的文件内容                  │
 │  3. CLI 读取项目里的 CLAUDE.md                   │
 │  4. CLI 把"你的话 + 文件内容 + 说明"打成一个包   │
 └────────────────────┬────────────────────────────┘
                      │  HTTPS 加密(类似银行网银)
                      ▼
 ┌─────────────────────────────────────────────────┐
 │ Anthropic 服务器(美国,可能也有其他区域)       │
 │                                                 │
 │  5. 大模型(Claude)处理这个包,生成回复         │
 │  6. 服务器把回复发回你的电脑                      │
 │  7. 日志在 Anthropic 这边**最多保留 30 天**      │
 │     之后删除(企业版有单独约定)                  │
 │  8. 这些内容**不用来训练模型**(2024-05 起的      │
 │     消费者用户可选;API / 企业版默认不训练)     │
 └─────────────────────────────────────────────────┘

关键事实要记住 5 条

  1. 传输过程是加密的——像你登录银行网银,中间没人能偷看。
  2. Anthropic 服务器会暂存你的内容——最多 30 天(用于审查滥用、调试),到期自动删除。
  3. 默认不用来训练模型——API / Claude Code 用户默认就不训练;消费者 Claude.ai 用户 2024-05 起也可以在设置里关。
  4. 文件读取发生在你本地,但内容会上传——@笔记.md 这个操作是 CLI 读完本地文件,把内容打进发给 Anthropic 的包里。文件本身不会被远程复制保存,但文件内容必然进入那个 30 天的暂存
  5. ! 跑的命令结果也会上传——你让 Claude 跑 lsgit log,结果会回显给 Claude 当作上下文。所以跑 cat ~/.ssh/id_rsa 这种事等于把密钥交给 Anthropic

11.2 "不训练模型"到底是什么意思

很多人对"训练模型"概念模糊。说人话:

  • 训练:把你的内容永久学进 AI 的"大脑参数"里。训练过的内容取不回来,未来某用户提问时可能间接"想起"你的内容。
  • 暂存:只是放在服务器上日志里,30 天内能用于排查滥用、bug 调查,过期删除,不会进 AI 的大脑

Claude Code 默认行为:

  • 暂存 30 天(用于滥用排查)
  • 不训练(你发的东西不会成为 AI 未来知识的一部分)

这是 Anthropic 对 API / Claude Code / 企业版用户的合同承诺,不是"应该会、大概不"——写在服务条款里。

📌 这不等于零风险:30 天暂存期内,如果 Anthropic 内部排查或被司法机关合法调阅,你发过的内容理论上可被访问。下面讲哪些东西真的不能放。

11.3 红线清单:这些东西绝对别发给 Claude

无论工具多靠谱,以下类型的内容就不应该出现在任何云端 AI 里(包括 ChatGPT、Gemini、Claude 都一样):

红线 1:凭证和密钥

  • API key、token、密码、证书私钥~/.ssh/id_rsa.env 里的密钥)
  • 数据库连接字符串mysql://user:password@host/db
  • OAuth refresh token、Cookie、JWT
  • 加密货币私钥、助记词

❌ 不能做:@.env 帮我加个新字段——.env 里的密钥就全传过去了 ✅ 改这样:把 .env 里的值替换成 <REDACTED>,或者单独把字段名告诉 Claude,不给值

红线 2:他人的个人信息

  • 客户 / 用户的身份证号、手机号、家庭住址、银行卡号
  • 身份证、护照、驾照、病历的扫描件 / 照片
  • 未脱敏的真实员工档案 / 客户名单

❌ 不能做:@客户名单.xlsx 帮我整理成邮件分组 ✅ 改这样:先把名单里的身份证号、手机号替换成 <ID_1> <ID_2>...,处理完再手动把原值填回去;或用假数据跑通流程,再自己套真数据

红线 3:公司机密 + 法律限制

  • 商业合同、报价单、未公开的财务报表
  • 核心代码(涉及核心算法、专利、商业模型)
  • 保密协议(NDA)覆盖的内容
  • 医疗、法律行业涉及个人隐私的档案(很多国家有明确法规)

❌ 不能做:直接把合同 PDF 交给 Claude 分析 ✅ 改这样:先问公司 IT / 法务部是否允许;或企业版 + 自建代理;或本地用开源模型

红线 4:会传染的内容

有些内容你以为是你的,其实别人的权利也掺在里面:

  • 朋友发你的聊天截图(泄露对方隐私)
  • 第三方付费资料(知识付费课件、订阅制数据)
  • 公司下发的内部文档(对你免费,但对 Anthropic 不免费)

判断标准:把这个内容发给 Claude,等于把它交给了一家美国公司的服务器(哪怕只暂存 30 天)。你有权这样做吗?

11.4 黄线清单:要小心的内容(可以发但先处理)

红线之外,还有一批"不是绝对不行,但要多想一步"的:

黄线 1:自己的隐私信息

  • 自己的身份证号、手机号、地址
  • 自己的私人笔记、日记
  • 自己的聊天记录、邮件

原则:你愿意承担它暂存 30 天的风险,就可以发。但注意上下文越长越难控制——这类信息发完后下次 /clear,别让它长期留在会话里。

黄线 2:公司内部可分享的内容

  • 公开的产品资料、技术博客草稿
  • 内部但非机密的工作流程、会议纪要
  • 同事间能随意转发的邮件

原则:查一下公司 IT 政策。很多公司已经有明确的"AI 使用规范"——允许用 Claude / ChatGPT 处理哪些等级的内容。没有政策就问 IT/法务一次

黄线 3:代码和项目

  • 非核心算法的业务代码
  • 没特别机密的配置文件
  • 公开 GitHub 仓库的内容(这类基本没问题)

原则:如果代码开源或准备开源——随便发。如果是公司闭源商业代码——企业版 / 私有化部署更安全,个人版先问一下。

11.5 公司 / 团队用户的决策清单

如果你是在公司里用 Claude Code,走一遍下面这张清单:

① 公司有没有 AI 使用政策?

  • :严格按公司政策(可能限制特定目录、特定数据类型)。
  • 没有先问一次(IT、法务、合规),别自己判断。很多踩坑的人是"没问就用"。

② 用的是哪个版本?

版本 数据暂存 训练模型 适合谁
个人 Claude Code 30 天 不训练 个人项目、开源、学习
Anthropic API(带自己的 key) 30 天 不训练 小团队、技术用户
Claude for Work / Enterprise 可定制(甚至 0 天) 不训练 公司、敏感数据
私有化部署(某些大客户) 数据不离开公司 不训练 金融、医疗、政府

如果公司涉及敏感数据,争取升级到企业版

③ 哪些任务可以用、哪些必须本地处理?

画一张自己的分类表

# 我的 Claude Code 使用边界

## 可以用(低风险)
- 整理个人笔记、写博客草稿
- 改开源项目代码
- 处理公开资料、翻译公开文档

## 先脱敏再用(中风险)
- 整理含个人数据的表格(先替换关键字段)
- 改公司内部文档(确认非机密后)

## 本地工具代替(高风险)
- 处理合同 / 财报 / 客户名单原始数据
- 改涉密代码
- 处理身份证、医疗档案

## 绝不交给任何云端 AI
- 密钥、密码、数据库凭证
- 未脱敏的身份证 / 银行卡
- NDA 覆盖的文档

本章小结

  • 一次对话的数据会经过:本地 → HTTPS 加密传输 → Anthropic 服务器(美国)→ 30 天暂存 → 删除
  • Claude Code 默认不训练模型——你发的内容不会进 AI 的大脑
  • 红线:密钥、他人个人信息、公司机密、NDA 内容——绝不发
  • 黄线:自己的隐私、公司内部非机密、业务代码——处理后或问过再发
  • 公司用户先问 IT/法务;涉密场景争取企业版或私有化部署

动手任务

任务 1:画你自己的"使用边界"表(15 分钟)

步骤

  1. 新建 ~/Desktop/ccguide-练习/使用边界.md
  2. 照 11.5 的模板,列出"你自己工作里的"4 类:可以用 / 先脱敏 / 本地处理 / 绝不上传
  3. 每类至少写 3 项具体任务

成功标志:看着这张表就能决定"这个任务能不能用 Claude"。

任务 2:查你公司的 AI 政策(10 分钟,如果在公司用)

步骤

  1. 搜索公司内网 / 邮件存档"AI 使用" / "Claude" / "ChatGPT"关键词
  2. 如果找不到明确政策,发一封邮件给 IT/合规:"我想用 Claude Code 处理 XXX 类型任务,公司是否允许?"
  3. 把回复存成 公司AI政策.md

成功标志:你有了明确的"上班可以用 / 不可以用"边界。

任务 3:脱敏练习(10 分钟)

步骤

  1. 找一个含敏感信息的真实文件(自己的通讯录、一份旧合同、一个 .env
  2. 复制一份(别改原件),手动把每个敏感字段替换成占位符(<NAME_1> <PHONE_1> <KEY_REDACTED>
  3. 记下你做脱敏的步骤,下次类似文件复用

成功标志:你掌握了"先脱敏再给 Claude"的基本流程。


如果你卡住了

症状 A:我的老板担心数据泄露,不让我用

  • 原因:合理——尤其涉及敏感行业。
  • 解决:给老板看本章 11.1 的数据流图 + Anthropic 的隐私承诺链接;申请企业版试点;从非敏感任务开始建立信任。

症状 B:不知道自己的任务算不算敏感

  • 原因:标准模糊。
  • 解决:默认当作敏感处理——要么脱敏再用,要么问一次。"保守一次"的代价远小于"泄露一次"。

症状 C:不小心把密钥粘进去了怎么办

  • 原因:手滑或忘了检查。
  • 解决:立刻去那个服务作废这个密钥(GitHub、云服务、API 平台都有"revoke"按钮);重生一个新的;别依赖"删除对话"——密钥已经传出去了。

主线结束。下面支线讲"数据保留的细节"和"本地化替代方案"。


🌿 【支线】—— 可选深入(学有余力再看)


🌿 支线 11.A:数据保留的几个细节

这段讲什么:30 天暂存、不训练——背后更准确的技术细节。 什么时候回头读:合规审查时,或要给老板 / 法务讲清楚时。

保留 30 天的内容具体是什么

  • 你发的所有 prompt(输入)
  • Claude 返回的所有回复
  • Claude Code 使用的元数据(工具调用日志、错误信息)

这些数据目的是"滥用检测"和"服务质量"——比如有人用 API 做违法事,Anthropic 能追溯。

企业版怎么更严

  • 零保留(Zero retention):数据过一下就扔,不暂存(某些套餐可配)
  • 区域化部署:数据只在特定区域处理(欧盟、亚太),不跨境
  • 审计日志自控:你可以自己保存、自己管理

如果你很在意

  • 消费者 Claude.ai 用户:设置 → Privacy → 关闭"Help improve Claude"(但这个开关不影响 Claude Code/API)
  • Claude Code / API 用户:默认就不训练,无需额外操作
  • 企业级:签合同时明确要求 Zero Retention / 私有化

一件事要知道

"不训练"的承诺是写在服务条款里的正式条款。Anthropic 如果违反,是合同违约——不是一句"我们原则上不这么做"。


🌿 支线 11.B:真的不敢上传,有没有本地替代

这段讲什么:如果你要处理的内容实在敏感,本地跑 AI 有哪些路。 什么时候回头读:确定了有内容不能云端处理时。

方案 1:本地开源大模型

Ollama / LM Studio 在本机跑开源模型(Llama、Qwen、DeepSeek、Mistral 等),完全离线——你发的内容不出你的电脑。

  • 优点:数据 100% 留在本地;长期免费
  • 缺点:智能度不如 Claude(参数量差好几倍);需要 16GB+ 内存;Mac 需要 M 系列芯片才跑得动

适合:写文档草稿、简单整理、不需要顶尖推理的任务

方案 2:混合工作流

  • 敏感部分本地做:原始数据用本地工具 / 本地模型处理
  • 结构化 / 脱敏后交 Claude:生成模板、做最终润色

例:合同审阅——原文本地看;只把条款提纲(去掉具体数字和名字)交给 Claude 让它检查逻辑。

方案 3:私有化部署

大公司可以从 Anthropic 采购企业版 / AWS Bedrock / GCP Vertex AI 托管的 Claude,数据走公司账户和 VPC,不经过公共 Anthropic 端点。

这需要公司层面采购,个人用户用不到。

一个实用建议

大多数零基础读者来说:

  • 日常工作任务(整理文件、写文档、翻译)—— Claude Code 完全够安全
  • 真正涉密的少数场景—— 本地 + 手工 仍然是最稳的选择
  • 不要因为"听说 AI 泄露"就全面拒绝,也不要因为"好用"就什么都上传

分档策略(11.4 / 11.5 的表),对不同风险做不同处理。


下一章:第 12 章"Claude 为什么会变糊涂"——讲上下文。这是本书技术最硬的一章,但我会从"一个熬夜的人为什么想不清楚"这个比喻开始讲起。


📖 ← 第 10 章 · 信任校准 · 📑 返回目录 · 第 12 章 · Claude 为什么会变糊涂 →