Skip to content

Latest commit

 

History

2 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

经济学人智能阅读助手 · Economist Reader

一个零部署、双击即用的单文件 HTML 工具:导入《经济学人》PDF → 自动生成目录 → 选文精读 → 选词即查并自动进生词本 → 读后全文解析 → 生词一键同步「不背单词」。

面向中文母语的英语学习者,解决精读英文期刊的三个真实痛点:选题难(几十页 PDF 不知从哪读起)、定位烦(多栏排版难以抽取正文)、语言障碍(生词长句卡住,查完就忘、无处沉淀)。


一、核心能力

阶段 能力 说明
导入 PDF 目录自动提取 浏览器端解析版式(字号/坐标/分栏),按「板块 → 文章标题 → 页码」生成可点目录,支持一键中英对照
阅读 正文智能重排 还原多栏顺序、去页眉页脚广告、接续断词、恢复首字下沉,得到干净可划选的正文
阅读 选词即点即查 选中单词点「查词·入生词本」,立即弹出释义卡(音标/词性/语境义/常见义/例句),并自动收入生词本
读后 全文自动解析 AI 通读全文,输出高频短语·地道搭配 8–12 个(可一键入生词本)与长难句精讲 4–6 句(译文/主干/语法点)
沉淀 生词导出 一键导出 .txt(不背单词可直导)与 .json(含原句与释义,供流水线与存档)
同步 打通不背单词 vocab_pipeline.py 做词形还原与跨期去重,bubei_sync.py 用浏览器自动化覆盖上传到自制词书

三栏布局(目录 / 阅读 / 标记解析)可拖拽调宽、可折叠,米色护眼配色,窄屏自动切换为底部分页,手机与 iPad 同样可用。

二、快速开始

1. 阅读器(无需安装任何东西)

用 Chrome 或 Edge 双击打开 经济学人阅读器_单文件版.html,点右上角「导入 PDF」即可。

想启用 AI 查词与解析,点「⚙ AI 设置」填入任一模型的 Base URL、API Key 与模型名。支持 Anthropic 与所有 OpenAI 兼容接口(DeepSeek、Kimi、智谱、OpenRouter、本地 Ollama 等)。配置只存于你本机浏览器的 localStorage,直连所选服务,不经任何中转,本仓库不含任何密钥。

浏览器直连部分服务商会被 CORS 拦截,OpenRouter本地 Ollama 对浏览器最友好。

2. 生词同步到「不背单词」

pip install lemminflect playwright && playwright install chromium   # 一次性

# 每周一条命令:词形还原 + 跨期去重 → 全自动覆盖上传
python3 vocab_pipeline.py --in ./exports --work ./vocab_data && python3 bubei_sync.py

bubei_sync.py 首次运行会打开浏览器请你登录一次(扫码/短信),登录态保存于 ~/.bubei_browser,之后免登录。默认把全量词书覆盖上传到词书「经济学人精读」,可用 --txt / --book 改目标。

三、数据流

PDF 导入 → 目录(板块+标题,可中英对照)→ 选文阅读
   │ 选词 → 即查释义卡 + 自动入生词本
   │ 读后 → 全文解析(高频短语 / 长难句 / 语法)+ 手动标记解析
   ▼
「导出生词」→ vocab_<期次>.txt / .json(exports/)
   ▼
vocab_pipeline.py → 词形还原 + 跨期去重 → 不背单词_全量词书.txt + 生词总表.csv
   ▼
bubei_sync.py → Playwright 自动登录官网 → 自制词书「经济学人精读」覆盖上传
   ▼
不背单词 App 复习

四、关于「打通不背单词」的事实说明

不背单词没有面向第三方的公开 API。 其唯一批量导入通道是官网 learnywhere.cn 的「自制词书」:上传一个 .txt 文件,每行一个单词,网站用自身语料库回填音标、释义与例句。

由此产生两个必须接受的约束,本项目的设计正是围绕它们展开:

  1. 只有「单词」这一列能进不背单词——你标注的原句与 AI 释义无法注入 App。因此 生词总表.csv(单词/词性/文中原句/中文释义)定位为个人存档 + 兼容墨墨、Anki、欧路等工具。
  2. 导入需要网页登录态——故采用 Playwright 持久化登录 + 文件选择框自动接管的方案;任一步定位失败会降级为「提示你手动点一下」的辅助模式,而非崩溃。

完整推演见 docs/04_不背单词自动化对接方案.md

五、仓库结构

经济学人阅读器_单文件版.html   主程序,双击即用,零依赖
vocab_pipeline.py              词形还原 + 跨期去重 + 产出词书/总表
bubei_sync.py                  不背单词自制词书全自动上传(Playwright)
docs/01_技术架构设计.md         三层架构、模块划分、数据模型、路线图
docs/02_系统提示词.md           各阶段 LLM 提示词模板
docs/03_实跑演示_2026-05-23期.md 真实一期的端到端跑通记录
docs/04_不背单词自动化对接方案.md 对接调研、约束、两档落地方案
docs/05_OneCloud系统提示词.md    工作流平台编排提示词
docs/06_本次优化说明_2026-08-23.md 即点即查 / 全文解析 / 全自动上传三项增强
examples/                      脱敏示例导出,可直接跑通流水线

六、待验证项

首次跑 bubei_sync.py 时请留意两点,跑通后可把实际按钮文字固化进脚本的候选选择器:

  1. 官网自制词书对同名词书重复上传是覆盖还是追加(当前假设为覆盖;若为追加,改用增量 txt 上传);
  2. 官网各操作按钮的实际文字与 DOM 结构。

七、免责声明

本工具不含、不分发任何《经济学人》内容,仅在你本地处理你自己合法获取的 PDF。请遵守你所在地区的版权法规与《经济学人》订阅条款。与 The Economist、「不背单词」均无隶属关系;bubei_sync.py 只是模拟人工的网页上传操作,请合理使用、勿滥用对方服务。

八、许可

MIT

About

零部署单文件 HTML 的《经济学人》智能阅读助手:PDF 目录提取、选词即点即查、读后全文解析,生词自动同步「不背单词」

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages