构效关系(SAR)研究怎么找研究空白?把散落的活性数据拼成一张矩阵
构效关系(structure–activity relationship, SAR)研究的起点通常不是「想做什么」,而是「手上的活性数据能说明什么」。多数人卡在同一处:同一类骨架的活性数据散在几十篇文献里,靶点不同、细胞系不同、单位不同(IC50 / EC50 / Ki / % 抑制),根本没法横向比较;而能比较的那几个格子,早就被人写过了。
这篇讲三件事:SAR 里什么样的缺口值得做、哪些「看起来像缺口」的其实是数据问题、以及一条可以重复使用的做法。
一、SAR 里三类真正值得做的缺口
- 数据缺口:同一骨架在某个靶点或某类取代基上缺少可比较的活性数据。注意「缺数据」有两种 —— 真的没测过,和测过但条件不同、口径不一致;后者本身就是一篇数据规范或方法类的选题。
- 机制缺口:活性随取代基变化的趋势有报道,但归因不清 —— 到底是电子效应、位阻,还是溶解度与渗透性把活性带偏的,文献只给现象、不做拆分。
- 迁移缺口:某条构效规律在骨架 A 上被反复验证,在骨架 B 上没人系统做过。这一类最好写,但审稿人第一句就会问「为什么 B 会跟 A 不同」;答不上这句,就只是重复劳动。
判断标准还是三条:有证据(每条趋势都能指到具体文献与段落)、可执行(缺的数据能在你的条件与周期内补齐)、值得做(补上的是规律,而不只是一个数值)。
活性表里的空格不一定都是机会:有的是没人做过,有的是做不出来,有的是测了但没法比。
二、四个最常见的误区
- 拿单一活性值当结论。 IC50 离开测定条件就没有可比性:细胞系、孵育时间、底物浓度、报告单位不同,差一个数量级很常见。跨文献比较之前,先把条件摊开列出来。
- 把相关性当构效关系。 活性区间只有两倍、样本只有五六个化合物时,任何回归都能「显著」。SAR 要的是覆盖足够宽的结构区间与活性区间。
- 只讲最好的那个化合物。 挑活性最高的讲故事、把中段与失活的丢掉 —— 恰恰是这些负结果定义了边界(哪个位置不能动),而边界才是同行最想知道的。
- 表格漂亮,数字对不上原文。 图表重排、单位换算、取整抄错,一处错就会被质疑整份数据。可回溯不是格式要求,是这项工作本身的信用。
三、一条可复用的四步做法
- 限定三件套。 靶点或表型 + 骨架与取代基位置 + 测定条件。缺一个,后面的矩阵就不成立。
- 建矩阵。 行是骨架与取代基组合,列是靶点 × 活性指标 × 条件;每格填数值、误差与来源段落。空格就是候选缺口。
- 对每个空格反查。 换检索式与数据库再搜一遍、查近三年综述,确认不是「测过没发表」或者「条件本来不可比」。
- 把空格写成可反驳的假设。「在 X 骨架的 R 位引入吸电子基,对 Y 靶点的活性单调上升,而现有报道只覆盖给电子基」—— 这一句就能直接设计实验。
四、我们怎么做这件事
ai4gap 把活性数据当作结构化字段来处理:骨架、取代基与取代位置、靶点、活性指标与数值、单位、测定条件、来源段落。近三年 SCI 千篇文献入库后跨文献对齐,把可比的数据并进同一张矩阵,把相互冲突的报道单独标出来,再输出带来源的缺口清单与研究综述。
两条红线不变:每条缺口都有文献证据,每个数字都能回溯到原文。
无 gap,不研究;无 gap,不发文。