临床 Python 进阶路线图
⌕ /
路线图 › 速查与资料

论文、技术资料与行业实践

临床统计编程这个行业的知识,绝大部分不在教科书里,而在会议论文里。 这一份告诉你:该去哪找、怎么搜、什么值得读。


1. 该关注哪些会议

会议 官网 特点
🟢 PharmaSUG(US) pharmasug.org 最实操。论文密度高、篇幅短、直接给代码。SAS 用户组起家,近年 Python/R/AI 专题大幅增加
🟢 PharmaSUG Japan pharmasug.org/conferences/japan2026 亚洲场次,议题更贴近亚太区实践
🟢 PHUSE(EU / US / China) phuse.global/events 更偏项目制与标准讨论,白皮书质量高
🔵 SAS Global Forum 见 SAS 官网 SAS 官方最大会议,近年也在谈开源集成
🔵 CDISC Interchange 见 cdisc.org CDISC 标准的落地实践,偏标准而非代码
🔵 R/Pharma rinpharma.com R 生态的年度会议。Python 方向的进展也常在这里讨论
🔵 PHUSE China phuse.global/events 中文区场次,值得国内同行关注

💡 2027 年 PharmaSUG US 已定:2027-06-06 ~ 06-09,Anaheim, CA。 见 pharmasug.org/conferences/pharmasug-2027-us


2. 去哪找论文全文

渠道 说明
🟢 会议官网的 Proceedings 页 PharmaSUG / PHUSE 每年会后会放出 PDF。从 pharmasug.org 进当年会议页面找 "Proceedings"
🟢 PHUSE 资源库 phuse.global/resources 与 advance.phuse.global
🟢 Lex Jansen 论文归档 https://www.lexjansen.com/ —— 收录了几十年间 SAS/PharmaSUG/PhUSE 等会议的绝大部分论文,是这个行业最重要的免费论文库。★ 部分企业网络可能访问受限,若打不开可换用会议官网
🔵 SAS Communities https://communities.sas.com/ —— 提问质量很高,很多疑难问题在这里有答案
🔵 Google 检索技巧 见下一节

3. 怎么搜论文(比"有哪些论文"更重要)

会议论文的价值在于具体问题,所以最好的检索方式是 用"你的具体问题 + 会议名"去搜。

高效检索模板

文本
"<技术名>" "<业务场景>" pharmasug
"<变量名>" "<标准名>" adam
"<问题描述>" site:lexjansen.com

实战例子(把问题直接翻译成搜索词):

你的问题 搜索词
怎么用 Python 读 XPT? read xpt python pandas pharmasug
AE 表的分母怎么定? adverse events table denominator subject level pharmasug
怎么自动生成 define.xml? automate define.xml metadata driven pharmasug
移位表(shift table)怎么做? lab shift table SAS python implementation pharmasug
SAS 程序怎么转 Python? migrating SAS to python clinical statistical programming pharmasug
AI 辅助编程在临床编程里的应用? large language model clinical statistical programming pharmasug AI
开源工具怎么验证? validation open source R python GxP phuse

按论文编号查(如果你拿到了编号)

PharmaSUG 的论文编号有前缀规律,知道前缀就知道大致主题:

前缀 主题方向
ET- Emerging Technologies / 新兴技术(Python、R、开源、自动化多在这一类)
AI- Artificial Intelligence / 机器学习与 Agent
AD- Analysis & Display / 分析与报表
DS- Data Standards / 标准与数据管理
QT- Quality & Testing / 质量与测试
PO- Poster / 海报
HW- Hands-On Workshop / 实操工作坊(最适合跟着做)

如果你记下了某篇论文的编号(例如 ET-223、AI-305), 直接在会议 Proceedings 页里按编号查找,或用 "<编号>" pharmasug 作为搜索词。


4. 必读的几类主题(按学习优先级)

优先级 1 —— 直接影响你每天的工作

主题 为什么必须读
Subject level vs Event level 计数 AE 表最常见的错误来源。分子到底该是"受试者数"还是"事件数",论文里有大量实例
Denominator / Analysis Population 分母错了整张表都错。SAFFL vs ITTFL vs EFFFL 的差异有专门论文讨论
Shift Table 的实现 实验室与生命体征移位表,各家实现细节差异极大
Partial / Imputed Date 规则 缺失日的补全规则(AE 起始日、用药起止日)会直接影响 TEAE 判定
PROC COMPARE 的替代方案 双编程验证是行业基本要求,怎么用 Python 做等价比对
CDISC 一致性检查 官方规则集见 cdisc-rules-engine

优先级 2 —— 决定你未来五年竞争力

主题 为什么值得投入
Metadata driven programming(元数据驱动编程) 从"手写每个数据集"到"由 spec 生成"。见 pharmaverse/sdtm.oak 与 analysis-results-standard
Dataset-JSON 与 XPT 的替代 cdisc-org/DataExchange-DatasetJson
LLM / Agent 在临床编程中的应用 代码迁移、QC 辅助、文档生成。★ 但必须理解合规边界(本项目第 16 章)
RWD / RWE 相关标准 真实世界证据是行业增量最大的方向
自动化 QC 与 CI/CD 把 QC 从"人工核对"变成"每次提交自动跑"

优先级 3 —— 合规与验证(决定"能不能用")

主题 去处
开源软件在 GxP 环境的使用 cdisc-org/COSMoS
开源工具的验证框架 phuse-org/valtools
Git 在统计编程中的规范 phuse-org/git-in-statistical-programming
PHUSE 方法学对照(SAS/R/Python) phuse-org/OSTCDA

5. 需要长期跟踪的"信息源清单"

把这几处加进你的收藏夹,每季度扫一次:


6. 怎么读一篇临床统计编程论文(方法论)

大部分论文的结构是:问题 → 为什么难 → 传统做法 → 新做法 → 代码 → 结果对比。 读的时候不要从头读到尾,按这个顺序:

  1. 先看结果的表长什么样(通常是第 1 张图/表) —— 这决定了"这篇论文解不解决我的问题"。
  2. 再看"传统做法 vs 新做法"的对比 —— 这里藏着口径差异,也就是最容易出错的地方。
  3. 然后看代码 —— 只抄你能读懂的部分。看不懂的逻辑,抄了也是隐患。
  4. 最后看作者的结论与限制 —— 论文作者通常会写"本方法不适用于……",这句最容易被忽略, 但往往决定了你能不能在自己的项目里用。

⚠️ 重要提醒:会议论文是个人/公司的经验分享, 不是监管要求。它说"可以这么做",不代表"你的项目可以这么做"。 最终依据永远是:SAP + 公司 SOP + 监管指南。


7. 中文学术与行业资料

来源 说明
中国临床试验数据管理学组(CDMC) 国内的临床数据管理专业组织,有年会与资料
DIA China 药物信息协会中国分会,常有临床数据与统计专场
NMPA 相关技术指导原则 国家药监局药审中心(CDE)发布的指导原则,是国内的合规依据
知网 / 万方 搜"临床统计编程""CDISC 实施""SDTM 映射"等关键词

💡 国内实践与国际标准在 CDISC 层面基本一致, 但在申报资料要求、数据递交格式(如 eCTD)上有本地化差异。 做国内项目时,以 CDE 的指导原则为准。


返回 → 项目主页 | 资料索引总览