Skip to content

第 6 章 处理真实世界的“脏材料”

真实材料不会排着队等你处理

练习包里的文件名、版本和目录都很规整,真实临床运营很少这么省心。邮件正文、微信截图、扫描件、带批注的 Word、合并单元格 Excel 和手写记录经常混在一起。WorkBuddy 可能读错内容,也可能把截图里的联系人、签名或通知栏一起带进工作区。我会先接收和筛查,再做任务副本,最后才交给 WorkBuddy。

这里说的“脏”,指结构混乱、上下文夹杂,并不是在评价文件质量。材料越乱,进入 WorkBuddy 前要做的人工检查反而越多。

我给材料安排了四个落点

text
原始接收区 → 人工风险筛查 → 批准的任务副本 → WorkBuddy 工作区
  • 原始接收区:保留原件和来源,不直接作为 WorkBuddy 工作区。
  • 风险筛查:识别受试者信息、联系人、签名、盲态、凭证、隐藏数据。
  • 任务副本:只保留完成目标所需内容,记录删改和版本。
  • 工作区:仅放批准输入、参考边界和输出目录。

可下载使用 “脏材料”接收清单

常见材料怎么处理

材料隐蔽风险进入前动作
微信/IM 截图群名、头像、手机号、通知栏、无关聊天裁切到最小范围;文字转录后人工核对;保留来源编号
邮件线程签名档、抄送人、历史附件、不同版本混杂提取与任务相关段落;记录发件日期和附件版本
扫描件/照片姓名、签名、受试者编号、手写旁注OCR 后逐页核对;敏感字段按政策遮挡;低清晰度标记待确认
Word修订、批注、隐藏文本、页眉页脚决定使用清稿还是修订稿;把选择写进任务卡
Excel隐藏表、公式、筛选、合并单元格、日期格式展开结构;保留原始值与显示值;不要只复制当前可见区域
SAS/R 日志_ERROR_PUT 可能打印受试者级数据值先清洗数据值;仅用虚构日志做初次验证

点“添加文件”之前,我会看五件事

“新建任务”的“+”菜单里有“添加文件”和“引用对话中的文件”。文件进场前,我会逐项检查:

  1. 这个文件是否已经进入批准的任务副本?
  2. 当前工作区是否足够窄?
  3. 引用旧对话文件会不会把另一个项目带进来?
  4. 文件里的隐藏内容是否也会被读取?
  5. 输出是否会暴露原本已遮挡的信息?

从聊天软件、邮箱或共享盘直接拖原件,往往会把无关对话、历史附件和隐藏字段一起带进来。“看看 AI 能不能读”也应当使用清理过的虚构副本。

入排核对有一段工作仍然留在 HIS 里

入排核对最花时间的部分,通常是去病历或 HIS 里找事实。通用 AI 往往碰不到这一步。教材里能做的是把入排标准拆成检查项,再对已经批准、最小化、脱敏的提取底表做交叉核对。这样的案例可以教核对方法,不能被宣传成“AI 帮你筛病人”。

看不清、对不上时,统一用四个状态

我在任务卡里只留四种状态:

  • 待确认:材料未给出事实;
  • 无法辨认:扫描/OCR 质量不足;
  • 版本冲突:两个来源给出不同值;
  • 超出范围:需要访问未获批准的系统或资料。

常识、相邻日期、岗位惯例和旧项目经验都不能拿来补事实。缺了什么,就把缺口原样留下。

自己造一套“脏材料”测一下

用同一段虚构会议内容做三份材料:一张带无关头像的截图、一份有批注的 Word、一个合并单元格表格。完成接收清单后,再制作最小任务副本。三次输出放在一起,很容易看出 OCR、批注和表格预处理分别会带来什么错误。

处理完后,目录里应该看得出原件和副本

  • [ ] 原件与任务副本分开保存
  • [ ] 截图、扫描、Word、Excel 的隐藏风险均被检查
  • [ ] 未把受试者级数据或凭证用于首次测试
  • [ ] 模糊信息使用四种受控状态之一

下一章:加载并验证第一个 GCP Skill →

面向 GCP 临床试验从业者的 WorkBuddy 实战读本 · Pixel icons by HackerNoon