Google DeepMind 推出 SynthID Bio:为 AI 设计蛋白质加入可验证来源标记

Google DeepMind 9 月 30 日介绍 SynthID Bio,尝试把不可见标记嵌入 AI 生成的蛋白质序列及结构,让研究者在数字模型以至实验室合成物中追踪来源。

Google DeepMind 于 2026 年 9 月 30 日介绍 SynthID Bio,把原本用于数字内容的 SynthID 思路延伸到合成生物学。它的目标不是替 AI 设计作出真假判断,而是在蛋白质序列或预测结构中嵌入不易察觉的签名,让签名可以被检测及用来追踪设计来源。

Google 表示,生成式 AI 已被用于蛋白质结构预测、全新蛋白质设计及噬菌体研究,但新设计可能绕过传统 DNA 合成筛查,而错误标记的合成 3D 结构也可能污染公共数据库。SynthID Bio 因应不同数据类型调整方法:在序列上细微引导氨基酸选择,在 3D 结构上调整预测原子坐标,尽量维持原有功能及结构分布。

在蛋白质结合剂测试中,Google DeepMind 把 SynthID Bio 与 ProteinMPNN 及 AlphaProteo 工作流结合,针对 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三个目标进行湿实验。官方表示,加上标记的设计在命中率、结合亲和力和天然序列多样性方面,与没有标记的版本相若,并成功制造出具有生物功能的蛋白质结合剂。这些结果来自 Google 的研究及实验回报,仍需要社群和独立研究进一步验证。

对于蛋白质折叠,方法是在 AlphaFold 3 的 diffusion network 一小部分加入可嵌入标记的能力,使预测的 3D 坐标本身带有可检测信号。Google 表示,这样做可以保持 AlphaFold 3 的预测准确度,并在面对数字噪音或轻微坐标改动时维持接近完美的检测率。标记若要成为实际的来源系统,仍要面对刻意篡改、重新格式化及跨工具链传递等问题。

SynthID Bio 的实际用途之一是协助 DNA 合成筛查。当一段陌生序列可能是 AI 新造而不是自然界已知序列时,筛查人员需要更多人工审核;如果能验证设计来自一个有安全控制的模型,供应商便可以更快分流可信设计,将资源集中在需要深入调查的项目。它也可能用于 Protein Data Bank、UniProt 和 GenBank 等数据库,协助标记或要求复核合成数据。

Google DeepMind 同时表示,团队正与 Stanford 及 Arc Institute 的 Hie lab 合作,把 SynthID Bio 用到 Evo 2 设计的噬菌体基因组;早期细胞培养测试显示标记后的噬菌体仍具功能。公司表示会公开方法论、代码、体外数据及模型权重,让研究社群可以复现和延伸这项工作。

这项技术的意义在于把来源证明放到生物设计本身,而不只依赖文件名称、提交者声明或事后数据库标签。不过,Google 也承认没有单一 biosecurity 措施是万灵丹。若要建立可靠的生物设计来源链,还要配合合成商审查、客户验证、可追溯 metadata、标准化检测及对抗蓄意规避的研究。SynthID Bio 是一层可验证信号,不是完整的安全制度。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。