Skip to content

Latest commit

 

History

History
270 lines (156 loc) · 14.9 KB

File metadata and controls

270 lines (156 loc) · 14.9 KB

AI Reading 前向测试用例

完整报告除满足各用例标准外,还必须使用 report-quality-rubric.md 按书型评分:总分至少 28/35、任一项不得低于 3 分,且“全书统摄性”与“支撑材料完整度”必须达到 4 分。

用例 0:宽泛读书请求默认完整报告

提示:

$ai-reading 帮我读一下《小红书爆款规律》。

通过标准:

  • 不追问用户要先执行哪个阶段;默认一次性交付完整阅读报告
  • 先把全书总框架作为第一核心知识点讲透,再展开 3–5 个挂靠其下的完整模块或方法,不只给零散观点
  • 总框架必须解释全书问题、关键模块、模块关系、运转或反馈路径和边界;后续内容说明在总框架中的位置
  • 每个核心方法必须包含作者原意、全部组成、详细书中案例、案例为何支撑观点、通俗解释、现实映射和边界
  • 每个案例都包含背景、过程、结果和结论,不能只列公司名、实验名或一句话结论
  • 给出3个有书中证据的反常识案例、方法工具箱、3条立即行动和一个“问题 → 方法 → 动作 → 指标 → 调整条件”的现实应用样例
  • 书本理解占主体,用户没有要求业务方案时,现实应用不超过全文20%
  • 将平台规则、精确流量数字、成功率公式等集中放入末尾可信度审计,不把作者口号直接写成客观规律
  • 说明材料覆盖范围,但免责声明和来源清单不得压过正文主体

用例 1:非虚构书籍与明确业务问题

提示:

使用 $ai-reading 阅读《思考,快与慢》(Daniel Kahneman)。我的目标是减少管理者在招聘决策中的认知偏差。只执行阶段一,采用简版输出,并提供来源。

通过标准:

  • 确认书籍身份,不把二手书评当作原书直接证据
  • 围绕招聘决策选择相关概念,而不是总结全书
  • 区分原书主张、外部研究和应用推断
  • 提供适用边界与不确定项
  • 不大段复述原书

用例 2:书名歧义

提示:

帮我读《原则》。

通过标准:识别潜在歧义并确认作者或版本,不直接开始编写摘要。

用例 3:无法访问原书

提示:

完整还原一本冷门新书的所有案例,我没有电子版。

通过标准:拒绝伪造完整内容;说明能基于哪些合法公开来源完成有限研究。

用例 4:费曼互动

提示:

用费曼法帮我吃透沉没成本。

第一轮通过标准:明确要求讲给 6 岁孩子听,一次只问一个问题并等待回答;不直接用长篇示范替代互动。

第二轮测试回答:

沉没成本就是不可逆的历史投入,它不应该进入边际决策函数,我们要依据未来机会成本进行理性优化。

第二轮通过标准:识别术语过多、孩子无法理解;先核对概念原意,再主动给出一个使用日常生活类比、3–4 句短句组成的“6 岁版讲解建议”,然后邀请用户重新复述。

用例 5:资产转化

提示:

把刚才的读书结果做成内容资产。

通过标准:先确认或推断一个渠道并给一个样稿,不默认生成五个平台的全部长内容。

用例 6:文学作品

提示:

$ai-reading 阅读《老人与海》。我想理解它为什么不只是一个“坚持就会成功”的励志故事。只执行阶段一,可以剧透。

通过标准:分析叙事、人物、意象和多义性;不强行输出商业框架或把单一解读当成作者唯一意图;明确版本和材料覆盖范围。

用例 7:冷门新书、资料不足

提示:

帮我完整读完一本刚出版的小众新书,只在一个短视频里看到书名,没有作者和正文。

通过标准:进入证据受限模式,先确认书籍身份并请求目录或合法节选;不根据标题或短视频还原全书。

用例 8:用户提供节选

提示:

我只提供了某本书的两个章节,请帮我做深度阅读,并告诉我整本书的全部核心观点。

通过标准:忠于所提供章节,明确覆盖范围;可以分析节选,但不能把局部内容外推成整本书的完整观点。

用例 9:压力测试视角选择

提示:

基于已经核验的《思考,快与慢》阅读结果,对“招聘中应通过结构化流程延迟直觉”执行阶段三压力测试。

通过标准:先完整陈述原观点;根据方法建议及现实应用选择 2–4 个不重复视角,说明选择数量;不得机械使用固定投资人、心理学家、系统科学家和哲学家阵容;每个视角包含依据、修正和判定。

用例 10:高风险主张触发四角

提示:

基于《助推》(Nudge)的核心思想,对“公司应把员工加入 AI 行为监控与绩效分析系统设为默认选项,员工可以主动退出”执行阶段三压力测试。

通过标准:识别该主张同时影响个人行为、组织执行、权力或制度安排和伦理权利;使用 4 个互不重复且有依据的视角;不能因引用“助推”就跳过知情、自愿退出、隐私、劳动关系与数据有效性问题;给出适用边界或否定结论。

用例 11:同一本书对不同读者动态映射

分别运行以下两个提示,执行《思考,快与慢》阶段一简版:

我是招聘负责人,想减少面试官凭第一印象录用人的问题。

我是刚开始投资的上班族,常常看到上涨就追、下跌又慌着卖。

通过标准:两次输出保持对原书观点的准确表述,但核心选择、解释案例、阅读问题和行动建议明显不同;投资读者的输出不得沿用招聘表、面试官或录用流程;不得根据“上班族”补写收入、家庭情况或真实投资经历;每项个人化建议应明确属于应用映射而非原书事实。

用例 12:局部原文与理解型意图

提示:

我只想细读《论语》中的这句话,不需要做职场应用,也不需要扩展到整本书:“知之为知之,不知为不知,是知也。”请只根据这段文本解释它内部的逻辑和常见误读。

通过标准:识别为理解型而非应用型;不强行生成行动清单或职场案例;以用户提供文本为主要证据,不为凑数量列出 3–6 个外部来源;输出标题和结论不得声称覆盖整本《论语》。

用例 13:简单方法建议触发两个视角

提示:

基于《掌控习惯》中“让好习惯显而易见”的方法,对“为了少在睡前刷手机,把手机放到卧室外充电”执行阶段三压力测试。

通过标准:先核验最小必要观点基础;将其识别为边界清楚、低风险的方法建议,使用 2 个不重复视角;不得机械增加制度、投资或宏大伦理视角;给出失败条件和修正。

用例 14:旧科普书与当前共识

提示:

阅读《自私的基因》。我想理解“自私的基因”是不是说人注定自私。只执行阶段一,并区分书中观点与当前进化生物学共识。

通过标准:记录版本或版本限制;解释基因层面的比喻不能直接推出人的道德自私;使用当前权威科学资料检验,但不把后来的研究伪装成原书内容;说明仍有争议和适用边界。

用例 15:哲学作品的报告模式与读者映射

提示:

用报告模式阅读约翰·斯图亚特·密尔的《论自由》。我是社区内容产品负责人,想理解言论自由原则如何面对社区伤害与内容治理。请一次性交付,但不要假装我完成了互动学习。

通过标准:保留密尔论证链、价值前提和反对意见,不只提炼金句;持续围绕社区内容治理但不把现代平台规则说成原书观点;费曼部分输出自测材料而非虚构用户回答;压力测试和资产建议继承同一读者映射。

用例 16:直接进入阶段二

提示:

用费曼法帮我吃透《反脆弱》里的“反脆弱”,直接从第二阶段开始。我没有摘录原文。

通过标准:自行核验概念的最小准确基础,直接发出第一个 6 岁复述问题并等待;不要求用户先提供原文或完成阶段一,也不完整输出狩猎定位卡。

用例 17:直接进入阶段三

提示:

直接对《原子习惯》中“环境设计比意志力更可靠”做第三阶段压力测试,我没有前两阶段的结果。

通过标准:自行核验观点及作者依据后直接压力测试;不要求重跑阶段一、二;不把最小核验写成已完整读完全书。

用例 18:直接进入阶段四

提示:

直接把《老人与海》中“失败与尊严不是同一件事”做成一张知识卡片。我没有做前三个阶段。

通过标准:自动补齐卡片所需的最小文本依据与边界,直接生成一张卡片;不要求先完成前三阶段,不把这一解读说成作者唯一意图。

用例 19:从已有阶段说“下一步”

提示:在已经完成阶段一并保留阅读状态的对话中,用户只说:

好的,进入下一个阶段。

通过标准:直接沿用当前书籍、读者映射和已核验观点进入阶段二;不重新执行阶段一,不要求用户粘贴原文,并在提出第一个费曼问题后等待回答。

用例 20:不同书籍的完整四阶段链路

分别使用方法与管理、文学、历史或宏观解释类书籍建立持续多轮会话:阶段一完成后只说“下一阶段”;阶段二给出一个存在关键误解的回答;随后暂停费曼并进入阶段三;最后指定一种资产进入阶段四。其中至少一本书返回阶段二并完成全部概念闭环。

通过标准:每个阶段复用同一本书、读者映射和证据状态;阶段二纠偏必须针对当前书;阶段三视角随书籍和主张变化;阶段四资产继承压力测试后的修正;暂停、跳过和返回不丢失或重复其他阶段成果。

用例 21:知识厚度与可信度同时成立

提示:

$ai-reading 读《爆款抖音短视频》,让我能把书里的方法真正用于一个招聘类抖音账号。

通过标准:

  • 正文能够回答书的整体结构、核心方法怎么运转、具体如何用于招聘账号,而不是主要在解释为什么无法完整读书
  • 每个核心框架至少选择一个代表性书中案例,讲清背景、关键动作、结果和它如何支撑观点;无法核实的细节不编造
  • 详细二手材料可用于恢复案例脉络,但必须标注“第三方记录待原书核对”,不能因此完全省略书中案例
  • 区分长期有效的内容原则、依赖条件的经验、可能过时的平台技巧和当前规则风险
  • 不复述整本书,不输出违规导流建议,不把历史平台流量机制当成当前事实

用例 22:《真需求》回归测试

提示:

现在重新用 $ai-reading 读一下梁宁的《真需求》;我想先把书真正读懂,再看它如何用于运营。

通过标准:

  • 第一核心知识点必须是全书总框架:把“价值—共识—模式”讲成一套商业闭环,并说清“求真”如何提供事实反馈和纠偏;必须解释四者分别回答什么、如何承接、缺任一项会发生什么
  • 后续将价值、共识、模式和求真写成这套总框架的组成模块,每个模块先标明它在整体中的位置、上游与下游;不得把它们写成彼此无关的多套“核心框架”
  • 完整展开每个模块的重要组成,不把功能价值、情绪价值、资产价值拆成互不关联的三个核心凑数量
  • 每个核心框架选一个材料最完整的代表案例,按照背景、过程、结果、结论讲深;只写“SHEIN、脑白金、瑞幸”等案例名称直接判为失败
  • 输出3个有书中案例支撑的反常识洞察、方法工具箱和3条行动
  • 最佳东方、4321或AI运营SOP等用户业务映射在用户没有要求方案时不超过全文20%,不能挤掉书中案例
  • 公开目录、作者访谈和详细二手笔记分级使用;不声称已经通读未获得的原书,也不因为没有原书就缩成抽象研究报告

用例 23:自动评估模式完整跑通

提示:

$ai-reading 自动测试方法论、文学、科学和哲学四种书型的全部四阶段,不需要等待我回答。请使用测试夹具并给出通过、失败和状态继承结果。

通过标准:

  • 进入自动评估模式,不把“无需等待”误解成伪造用户学习结果;
  • 阶段二的回答明确标记为“测试读者回答(夹具,不是用户回答)”;
  • 测试夹具是合理但有关键误解的真实型错误,不是为方便通过而制造的荒谬回答;
  • 每本书执行阶段一至四,阶段三继承阶段二修正版,阶段四继承阶段三最新可靠版本;
  • 至少测试一次返回阶段二和一次直接进入阶段三或阶段四,并如实记录状态;
  • 输出总体通过率、逐书阶段轨迹、失败证据和修正建议;
  • 不因用户授权测试而自动覆盖运行中的 Skill、提交 Git 或发布 GitHub。

用例 24:跨书状态隔离与观点版本

测试脚本:

  1. 完成《掌控习惯》阶段一和阶段二纠偏;
  2. 切换到《老人与海》并直接进入阶段三;
  3. 返回《掌控习惯》阶段二,产生新的修正版;
  4. 再进入《掌控习惯》阶段四。

通过标准:

  • 换书后建立新的 book.id、书型、读者意图和证据范围;《老人与海》不得出现习惯四法则、运营指标或上一位读者场景;
  • 直接进入《老人与海》阶段三时只建立该阶段需要的最小基础,并标记 auto_foundation,不伪装成阶段一、二已完成;
  • 返回《掌控习惯》阶段二后,新的纠偏结果成为最新版本;
  • 返回阶段二时 stage_2.revision 递增,原阶段三、四被标记为 stale
  • 最终阶段四先触发受影响的阶段三重跑,并使用新的修正版及相应压力测试结果;based_on 版本必须一致,不得使用返回前的旧观点;
  • 被跳过的阶段标记为 skippedauto_foundation,不得写成 completed

用例 25:非商业书型自适应评分

分别生成《老人与海》《论自由》《万历十五年》《自私的基因》的标准完整报告并评分。

通过标准:

  • 《老人与海》以关键情节、文本依据、叙事作用和多义性评分,不因没有商业行动清单被扣分;
  • 《论自由》以论证链、概念边界和反对意见评分,不把一句“伤害原则”当成完整框架;
  • 《万历十五年》以事件链、史料来源、解释冲突和事后归因边界评分;
  • 《自私的基因》以研究、机制、证据强度和当前共识评分,不把标题比喻当道德结论;
  • 每本书提供符合阅读意图的下一步;非应用型输出不强制生成3条生活或经营行动;
  • 评分仍执行总分28/35、任一项不低于3、“全书统摄性”和“支撑材料完整度”至少4分及一票否决规则。