输入GPCR(基因名/UniProt编号/蛋白名),即可在线查询PTM位点,包括已查证有实验报道的位点,有支持但尚未定论的位点(推断或相似性注释、数据库或文献命中、高通量单一检出),以及基于规则提出的预测位点。
requests>=2.28
网页服务基于 Python 标准库,无需额外安装 Web 框架。
python webapp.py # 默认 http://127.0.0.1:8000,启动后自动打开浏览器
python webapp.py --port 9000 # 自定义端口
python webapp.py --host 0.0.0.0 # 允许局域网访问
python webapp.py --no-browser # 启动后不自动打开浏览器报告页内含三维结构视图:从 AlphaFold DB 拉取该蛋白的预测结构 15,16,把全部 PTM 位点按证据层着色(粉=已查证 / 银=有支持 / 紫=预测)标注到结构上,支持按层/PTM 类型过滤、按 pLDDT 置信度给卡通着色、悬停查看概要、点击打开证据详情。结构文件首次访问时下载并缓存到 data/structures/(AFDB 升级模型版本后最多 90 天内自动跟进重下),离线或该条目无预测模型时该区块自动降级为文字说明,其余报告不受影响。
python main.py ADRB2
python main.py P07550
python main.py OPRM1 --verbose程序默认只查在线接口(UniProt / PubMed / AlphaFold DB),开箱即用。iPTMnet 与 dbPTM 两路文献证据只有离线包、没有在线查询通道(iPTMnet 实时 API 因上游长期不可用已移除,dbPTM 官方仅提供批量下载),建议在使用前预先装好;缺失时分析仍可运行,但报告不含这两路文献位点,进度行会给出安装提示。装好离线包后,文献核验可离线完成(PubMed 摘要预热后 7 天内离线命中,见下);序列获取与摘要过期后的重抓仍需联网。
- UniProt 离线包(下载约 120 MB,解压后磁盘约 475 MB,可选):
python update_ptm_db.py --uniprot(独立安装入口,7 天新鲜期内跳过重下;需强制重下时删除data/uniprot_sprot_human.dat后重跑)。可选件——缺失时自动纯在线运行,只是少一路 Swiss-Prot 离线证据通道。 - iPTMnet 批量包:
python update_ptm_db.py --iptmnet。iPTMnet 唯一数据通道(实时 API 已移除),位点来源标注 "iPTMnet-bulk"。 - dbPTM 批量包:
python update_ptm_db.py --dbptm。官方无在线接口:从 2025 新站(NYCU)下载四类实验文件,自动入库为本地 SQLite(约 160 MB,按蛋白索引、查询毫秒级),位点并入「有支持」层。--all一次装齐上述三个离线包,装完自动做全 GPCR 域 PMID 摘要预热。 - 更新频率:两个批量包的上游更新都很慢——iPTMnet 的 ptm.txt 上次更新 2025-10,dbPTM 四类实验文件自 2021-09 未再变动;每 3–6 个月重跑一次
update_ptm_db.py --all检查即可(文件未变时重复下载无副作用,仅耗时)。 - 文献核验缓存:PubMed 摘要按批抓取(每请求至多 200 条),首次分析一个受体通常数秒完成。摘要缓存 7 天过期后重抓(可见撤稿/勘误标记);PubMed 明确回答“查无此编号”的死链引用同样缓存 7 天、到期自动复核(不反复空查);网络故障不缓存、下次运行自动重试;断网时批量请求一失败即跳过整轮抓取(不对每条 PMID 逐条空转重试)。可选预热:
python update_pmid_cache.py一次抓全全人类 GPCR 域的摘要(实测约 956 条、约 2 分钟,含一次性 UniProt 离线包下载),此后 7 天内所有分析的文献核验离线秒回;该预热在update_ptm_db.py任一包安装成功后也会自动执行。
基于规则的预测,不是机器学习。 程序不训练数据、不学习参数,而是套用明确、成熟的生物学规则,因此每个结果都有可追溯的理由、完全可复现。候选位点分三步产生:
-
motif扫描 —— 在序列中搜索公认的共识motif,每类 PTM 背后都有明确的生化机制:
- 磷酸化 扫描丝氨酸/苏氨酸上的激酶共识(PKA、PKC、CK1、CK2、CDK/MAPK 等经典 motif 1,2)。GRK(GPCR 激酶)没有可靠的线性 motif 3,4,仅以"邻近酸性残基 + S/T 簇集"作弱位置提示 5,6。此外还扫描 GPCR 专属的 pXpp 三磷酸簇
[S/T]-X-[S/T]-[S/T]——三个磷酸化 S/T 残基(p 代表磷酸化的 S/T,不是脯氨酸),是 arrestin 募集的关键模块 7。pXpp 在不同 GPCR 中的分布位置不同:趋化因子/肽类受体(class B)的 pXpp 富集于 C 端尾,胺类受体如多巴胺/肾上腺素能(class A)的 pXpp 则富集于较长的第三胞内环(ICL3)7。因此程序会先按受体的 arrestin 行为判组(依据 Isaikina 2023 的 Table S2 实验分类 7,26 个受体;未命中者按 ICL3 长度回退),只在 pXpp 典型分布的区域报告,过滤原文标明 pXpp 缺失的区域——例如 class A 受体的 C 端尾 pXpp 命中会被过滤,反之 class B 受体的 ICL3 pXpp 会被过滤。 - N-糖基化 扫描 N-X-S/T sequon(X≠P)。糖基化的本质是膜表面 trafficking 的质量控——缺少糖基化的受体会滞留胞内、难以到达细胞膜,但糖基化位点在 N 端还是胞外环并不关键(任一处都能补救表面表达)8。
- 棕榈酰化 扫描胞内半胱氨酸(Cys),重点是 TM7 后膜旁区的 Cys——硫酯键把 Cys 锚定到质膜内侧,形成"第四胞内环",稳定受体构象 9。
- 泛素化(保守版)扫描胞内赖氨酸(Lys)+ 邻近 PPxY 或 Pro-rich 区。泛素化决定受体内吞后的去向(降解或循环)10;Nedd4 家族 E3 连接酶通过其 WW 结构域识别底物的 PPxY (P-P-x-Y) motif 来完成泛素化"挂载" 10,11。但 PPxY 多出现在 adaptor 蛋白(如 ARRDC3)上而非 GPCR 自身,因此此规则只能作保守弱提示,恒低置信。
- 磷酸化 扫描丝氨酸/苏氨酸上的激酶共识(PKA、PKC、CK1、CK2、CDK/MAPK 等经典 motif 1,2)。GRK(GPCR 激酶)没有可靠的线性 motif 3,4,仅以"邻近酸性残基 + S/T 簇集"作弱位置提示 5,6。此外还扫描 GPCR 专属的 pXpp 三磷酸簇
-
膜拓扑过滤 —— 只保留生化上正确的位置:N-糖基化必须在胞外(酶在内质网腔);磷酸化/棕榈酰化/泛素化必须在胞内(激酶/E3 连接酶在胞浆)。这一步滤掉绝大多数假阳性。对磷酸化位点还会按其相对 TM7 的位置标注近端(TM7 后 ≤15aa,主要驱动脱敏)或远端(>15aa,主要驱动内吞与 arrestin 介导的信号)——对应 arrestin 的近端/远端 micro-locks 机制 12。
-
保守性与评分 —— 功能性 PTM 位点通常跨物种保守,因此与其他物种的直系同源比对,保守的位点权重更高,最后统一排序。得分为0–1的排序值,只用于排序,不代表概率;置信度High/Medium/Low由motif强度+保守性决定。共识motif只是必要而非充分条件,请把排序当作假设参考。
每条预测位点都附带支撑该规则的文献依据(HTML 报告中以可点击 DOI 形式给出,如 pXpp 位点对应 Isaikina 2023 7、C 端尾位点对应 Sente 2018 12 等),便于直接核验规则来源。
报告页(网页端与 CLI 生成的自包含 HTML 均支持)提供 AlphaFold 预测结构上的位点映射 15,16:
- 残基编号与 UniProt 一致,位点与结构直接一一对应;放置标记前校验模型残基名与序列字母一致,序列版本漂移的位点跳过并计数注明。
- 渲染使用 vendored 的 3Dmol.js(BSD-3,本地
static/vendor/,无 CDN 依赖);CLI 报告把渲染库与结构数据全文内嵌(约 1MB),双击离线可看;网页端经/api/structure懒加载,结构缓存在data/structures/。 - 位点球颜色与序列标注/位点签一致(绿 L1 / 琥珀 L2 / 紫 L3);弹窗内「在结构中定位」可跳转缩放到该残基。
除了上述预测规则的来源文献,程序对数据库已有点位的文献引用也会做核验:抓取所引用 PMID 的 PubMed 摘要,确认是否真正支持"该残基+该PTM类型",给出三种判定:
- 直接 —— 摘要点名了该残基与该修饰。
- 间接 —— 论文确实在讲该蛋白的该修饰,但未点名该残基。
- 不支持 —— 摘要指向的是别的残基或别的蛋白(例如把Tyr364的论文挂在Ser364位点上)。这类情况往往暴露了数据库的误归属。
这套规则本质是序列 motif + 膜拓扑 + 跨物种保守性的启发式组合,不是机器学习模型(如 NetPhos 或 PhosphoSitePlus 的 SVM/DNN),也没有做溶剂可及性计算(用"胞内环 + C 端尾"作膜可及性代理)。具体到各类 PTM:
- 磷酸化没有强线性 motif,假阳性偏高——这也是程序设置保守度权重而非单纯 motif 匹配的原因。pXpp 三磷酸簇的判组过滤依赖 Table S2 的 26 个受体(一手实验数据),未命中的受体走 ICL3 长度回退:只有 ICL3 明确很短(<~5aa)或很长(>100aa)才能判组,中间地带(5–100aa)无法判组、两区 pXpp 均保留(不过滤)。"多磷酸化簇"标注是基于局部 S/T 密度的代理,真正的 barcode 取决于磷酸化位点的组合与排列而非单纯密度 13,所以这些标注只能定位候选区,不能判定确切的磷酸化模式。CK1 规则同样只能作弱提示:其共识为 pS/pT-X-X-S/T,要求候选位点上游第 3 位存在已磷酸化的引物残基 14,而纯序列无法确认引物是否真的被磷酸化,因此 CK1 命中在所有激酶 motif 中权重最低、恒为低置信。其余激酶 motif 采用的是简化形式,与一手实验数据存在已知偏差:PKC 规则取传统简化写法
[S/T]-x-[R/K](+1 位碱性,另以 i−1 位疏水残基加分),而定向肽库实验显示经典 PKC 同工酶偏好 +1 位疏水、碱性残基集中在磷酸化位点 N 端一侧(−3 等)17;CDK/MAPK 的完整共识为 S/T-P-x-K/R(碱性残基在 +3 18),程序检查的是 +2 位、判据偏紧;CK2 规则同时接受 +2/+3 位酸性残基,较规范最小共识(+3 位酸性 2)略放宽。GRK 弱提示的窗口与阈值(±7 位内 ≥2 个酸性残基、±10 位内 ≥2 个 S/T)为启发式设定、无文献出处;且"邻近酸性残基"的偏好存在亚型与底物依赖的反例(如 GRK2 对 NTSR1 的位点特异性磷酸化并不依赖上游酸性残基 19),故该提示只参与排序,不能作为激酶归属的依据。 - 泛素化无可靠线性共识,PPxY 又常位于 adaptor(ARRDC3 等)而非 GPCR 自身,故 adaptor 介导的泛素化无法检出;该规则仅作保守弱提示,恒低置信、需实验确认。
- 保守性通过精确基因名查直系同源,主要命中哺乳动物,保守区域易饱和到接近 1.0。
- 三维结构视图使用 AlphaFold 预测模型而非实测结构 15,16:低 pLDDT 区域(偏橙红,多为无序 C 端尾与内环——恰是 PTM 密集处)构象不可靠,位点球仅表示序列位置映射,不代表实测构象;AlphaFold 覆盖不到的条目(如片段序列)无三维视图。
总体而言,所有预测位点都应视为可检验的假设,而非确证结果;排序用于优先级参考。
- UniProt —— 序列、拓扑、PTM注释与证据代码
- iPTMnet —— 带PMID的文献PTM位点(离线批量包:
update_ptm_db.py --iptmnet,位点来源标注 "iPTMnet-bulk";实时 API 通道已于 2026-08 移除) - dbPTM —— 实验验证的PTM位点(离线批量包:
update_ptm_db.py --dbptm,官方无在线接口) - PubMed —— 逐条核验所用的摘要
- AlphaFold DB 16 —— 三维结构视图所用的预测结构(AF2,B-factor 列为 pLDDT)
本项目采用 MIT License 开源。引用结果时请注明底层数据来源(UniProt、iPTMnet、dbPTM、PubMed、AlphaFold DB)。三维视图内嵌 3Dmol.js(BSD-3-Clause,见 static/vendor/LICENSE-3Dmol.txt)。
- Kennelly PJ, Krebs EG. Consensus sequences as substrate specificity determinants for protein kinases and protein phosphatases. J Biol Chem. 1991;266(24):15555–15558. doi: 10.1016/S0021-9258(18)98436-X
- Pinna LA, Ruzzene M. How do protein kinases recognize their substrates? Biochim Biophys Acta. 1996;1314(3):191–225. doi: 10.1016/S0167-4889(96)00083-3
- Tobin AB. G-protein-coupled receptor phosphorylation: where, when and by whom. Br J Pharmacol. 2008;153(Suppl 1):S167–S176. doi: 10.1038/sj.bjp.0707662
- Komolov KE, Benovic JL. G protein-coupled receptor kinases: past, present and future. Cell Signal. 2018;41:17–24. doi: 10.1016/j.cellsig.2017.07.004
- Onorato JJ, Palczewski K, Regan JW, Caron MG, Lefkowitz RJ, Benovic JL. Role of acidic amino acids in peptide substrates of the beta-adrenergic receptor kinase and rhodopsin kinase. Biochemistry. 1991;30(21):5118–5125. doi: 10.1021/bi00235a002
- Asai D, Toita R, Murata M, Katayama Y, Nakashima H, Kang JH. Peptide substrates for G protein-coupled receptor kinase 2. FEBS Lett. 2014;588(13):2129–2132. doi: 10.1016/j.febslet.2014.04.038
- Isaikina P, Petrovic I, Jakob RP, et al. A key GPCR phosphorylation motif discovered in arrestin2⋅CCR5 phosphopeptide complexes. Mol Cell. 2023;83(12):2108–2121.e7. doi: 10.1016/j.molcel.2023.05.002
- García Rodríguez C, Cundell DR, Tuomanen EI, Kolakowski LF Jr, Gerard C, Gerard NP. The role of N-glycosylation for functional expression of the human platelet-activating factor receptor. J Biol Chem. 1995;270(42):25178–25184. doi: 10.1074/jbc.270.42.25178
- Hussain W, Khan YD, Rasool N, Khan SA, Chou KC. SPalmitoylC-PseAAC: a sequence-based model developed via Chou's 5-steps rule and general PseAAC for identifying S-palmitoylation sites in proteins. Anal Biochem. 2019;568:14–23. doi: 10.1016/j.ab.2018.12.019
- Kennedy JE, Marchese A. Regulation of GPCR trafficking by ubiquitin. Prog Mol Biol Transl Sci. 2015;132:15–38. doi: 10.1016/bs.pmbts.2015.02.005
- Min B. In silico identification and in vitro validation of NEDD4-mediated GPCR ubiquitination. 2012. 见 AMiner 条目
- Sente A, Peer R, Srivastava A, et al. Molecular mechanism of modulating arrestin conformation by GPCR phosphorylation. Nat Struct Mol Biol. 2018;25(6):538–545. doi: 10.1038/s41594-018-0071-3
- Latorraca NR, Masureel M, Hollingsworth SA, et al. How GPCR phosphorylation patterns orchestrate arrestin-mediated signaling. Cell. 2020;183(7):1813–1825.e18. doi: 10.1016/j.cell.2020.11.014
- Venerando A, Ruzzene M, Pinna LA. Casein kinase: the triple meaning of a misnomer. Biochem J. 2014;460(2):141–156. doi: 10.1042/BJ20140178
- Jumper J, Evans R, Pritzel A, et al. Highly accurate protein structure prediction with AlphaFold. Nature. 2021;596(7873):583–589. doi: 10.1038/s41586-021-03819-2
- Varadi M, Anyango S, Deshpande M, et al. AlphaFold Protein Structure Database: massively expanding the structural coverage of protein-sequence space with high-accuracy models. Nucleic Acids Res. 2022;50(D1):D439–D444. doi: 10.1093/nar/gkab1061
- Nishikawa K, Toker A, Johannes FJ, Songyang Z, Cantley LC. Determination of the specific substrate sequence motifs of protein kinase C isozymes. J Biol Chem. 1997;272(2):952–960. doi: 10.1074/jbc.272.2.952
- Örd M, Möll K, Agerova A, Kivi R, Faustova I, Venta R, Valk E, Loog M. Multisite phosphorylation code of CDK. Nat Struct Mol Biol. 2019;26(7):649–658. doi: 10.1038/s41594-019-0256-4
- Inagaki S, Ghirlando R, Vishnivetskiy SA, Homan KT, White JF, Tesmer JJG, Gurevich VV, Grisshammer R. G protein-coupled receptor kinase 2 (GRK2) and 5 (GRK5) exhibit selective phosphorylation of the neurotensin receptor in vitro. Biochemistry. 2015;54(28):4320–4329. doi: 10.1021/acs.biochem.5b00285