开云体育(中国)官方网站东说念主类基因组包含高出 30 亿个碱基对-开云(中国大陆)kaiyun网页版登录入口

发布日期:2026-08-20 22:52    点击次数:126

在大数据时期,咱们每天都在制造海量的信息,包括发送的音信、拍摄的像片、酬酢媒体上的视频以及科研实验的数据等。凭据调研机构 IDC 的权衡,到 2028 年,民众每年产生的数据总量将高出 380 ZB(1ZB 约等于 1 万亿 GB),尽头于 3800 亿块家用 1 TB 的挪动硬盘所能存储的内容。

面临如斯庞大的数据体量,咱们现时使用的存储序论,举例磁带、光盘和硬盘,正变得越来越难以知足需求。这些开拓不仅容量有限,能耗高,何况寿命较短,导致无数数据都无法得到恒久、可靠的保存。

为了鄙俚这一挑战,科学家们驱动探索新的存储方式,他们把见识投向了 DNA ——这种存在于生物体内的分子,能够褂讪地传递遗传信息长达数百万年。更弥留的是,DNA 自然具有极高的存储密度和极低的能耗,这使其成为竣事大鸿沟、恒久存储的潜在梦想载体。

近期,国度生物信息中心应用发展部陈非辩论团队与中国科学院狡计期间辩论所处理器宇宙要点实验室谭光明、卜东波团队、中科狡计期间西部辩论院段勃团队联接,联想出了一套全新的 DNA 存储系统,并将其定名为"毕昇一号",以至敬中国古代活字印刷术的发明东说念主毕昇。毕昇一号以" DNA 活字"为中枢,将数字信息"打印"到 DNA 之中,大幅裁减了 DNA 存储的老本,为 DNA 存储的实用化带来了新的可能。

DNA 存储的旨趣与上风

要通晓毕昇一号的立异之处,咱们起始需要了解 DNA 存储本人的旨趣与上风。

DNA,学名脱氧核糖核酸,是生命体顶用于储存遗传信息的分子。它的结构类似一条长链,其中包含四种碱基:A(腺嘌呤)、G(鸟嘌呤)、C(胞嘧啶)和 T(胸腺嘧啶)。这些碱基通过特定的方式配对枚举,纪录着生命体从外貌到功能的全部遗传信息。下图展示了这四种碱基的配对方式:A 老是和 T 配对,C 老是和 G 配对,它们通过氢键聚首,组成了 DNA 的基本单位。

DNA 的基本组成结构及四种碱基配对方式(图片开始:维基百科)

在狡计机中,各边幅式的数据本色上都所以" 0 "和" 1 "组成的二进制串的样式存储的。DNA 存储的基本心趣,等于将这些二进制信息调度为特定的碱基序列。举例,不错设定 A 对应" 00 ",G 对应" 01 ",C 对应" 10 ",T 对应" 11 "。这么一来,任何文本、图片或视频都能被编码为一串 DNA 序列;通过东说念主工合成这些序列,信息就被写入了 DNA 分子中。当需要读取数据时,再用 DNA 测序期间读取碱基的枚举轨则,反向解码回二进制,就能还原出原始数据。

与传统的存储开拓比较,DNA 存储展现出多种显贵上风。起始是极高的数据密度。比如,东说念主类基因组包含高出 30 亿个碱基对,但其分量仅为 3 皮克(1 皮克等于一万亿分之一克)。其次,DNA 具有惊东说念主的褂讪性。在当然条目下,若是储存稳当,它不错保存数万年不被破损。科学家就曾收效从数万年前的猛犸象遗骸中索求出可读取的 DNA 序列,这一才略远远高出现时存储开拓几十年的寿命。临了,DNA 不依赖电力保管,不像传统的硬盘或做事器需要如期保重和握续供电,适用于保存恒久数据。

连年来,DNA 的测序和合成期间都取得了巨大的证实,为 DNA 存储的可行性奠定了坚实的基础。在这么的布景下,科学家们驱动尝试寻找愈加高效和低老本的存储方式,让这一期间能够信得过应用于现实。基于这一理念开发的"毕昇一号"系统,恰是 DNA 存储向实用化迈出的重要一步。

从陈旧的活字印刷术到

当代的" DNA 活字"存储术

活字印刷术是中国古代四大发明之一。在此之前,册本的复制主要依靠雕版印刷,也等于为每一页内容单独雕琢一块书版。雕版印刷刻出一版后就不错印出无数份,但这种措施制作老本高、恶果低、难以无邪治疗内容。直到北宋年间,中国发明家毕昇发明了活字印刷术,将雕版拆分为一个个不错类似使用的字块,在印刷时按需组合,用完后还不错拆卸保存,大大擢升了排版恶果。

DNA 存储的发展也正在阅历着类似的演变。现有的 DNA 存储期间大多类似雕版印刷,需要为每个文献重新驱动进行不菲且耗时的一次性 DNA 合成。为了搞定这一问题,辩论团队从活字印刷术中赢得灵感,立异性地漠视了 DNA 活字的想法。他们联想出一套不错预制和复用的 DNA 片断,使 DNA 存储从"一次性合成"升沉为"编码拼装",大幅裁减了 DNA 合成和存储老本。

DNA 活字是一种事先合成好的短链 DNA 片断,每条片断中间含有 20 个用于存储信息的碱基对,两侧则带有有利联想的黏性结尾(类似字块的"接口")以用于聚首。这种联想让每个 DNA 活字不错暗示一个信息单位,也不错像字块相似摆脱组合、轨则拼接,最终存储一段竣工的信息。

下图展示了五个 DNA 活字的结构示例,它们共同编码了莎士比亚的《十四行诗》中的单词" white "。每个 DNA 活字代表一个字母,而它们的黏性结尾则确保这些字母按照正确轨则逐个聚首,最终拼出的长链就像印好的诗句相似,竣工存储了盘算信息。

DNA 活字(DNA-MT)(图片开始:参考文献 [ 1 ] )

毕昇一号:DNA 存储的活字打印机

为了将 DNA 活字这一理念信得过酿成现实,竣事 DNA 存储的自动化,辩论东说念主员联想并搭建了 DNA 活字喷墨打印机——毕昇一号。这个系统结合了 DNA 活字与当代喷墨打印期间,安装有多个 DNA 墨盒,并内置录像头和图像分析软件,用于及时检测喷墨过程中的故障,从而保证较高的收效用。

毕昇一号(图片开始:参考文献 [ 1 ] )

毕昇一号现实责任进程分为四个重要方法:编码、打印(拼装)、存储妥协码。

第一步是编码。系统起始将需要存储的数据诀别为些许较小的片断,并将其调度为二进制方法。随后,这些二进制片断会被拆分为更小的信息单位,凭据每个信息单位的内容,自动匹配相应的 DNA 活字。

第二步是打印。这是毕昇一号的中枢重要,它行使类似喷墨打印的期间,将 DNA 活字按需输出。通过酶促反馈,这些 DNA 活字能被准确构建成长链 DNA。这个过程中无需再行合成任何碱基序列,大幅擢升了恶果。

第三步是存储。这些拼装完成的 DNA 并不会被胜仗冷冻保存,而是被进一步克隆到质粒中。质粒是一种自然存在于细菌体内的袖珍环状 DNA 分子,常被用作实验载体。辩论东说念主员将构建好的 DNA 片断插入到质粒中,再将其导入到大肠杆菌细胞之中。细胞在当然孕育养殖的同期,也会束缚复制所捎带的 DNA,从而竣事褂讪、低老本的生物存储与数据拷贝。

临了一步是解码。当需要索求数据时,只需对保存的 DNA 进行测序,识别其中包含的 DNA 活字序列,即可还原出原始的二进制内容,最终规复出可读取的文献。为了提高系统的准确率,辩论东说念主员在每个片断中还联想了极度的校验信息,用于检测和诞生可能的失实。

毕昇一号的责任进程(图片开始:参考文献 [ 1 ] )

值得一提的是,毕昇一号所使用的 DNA 活字全部由东说念主工事先合成并存储在墨盒中。一朝合成完成,每个 DNA 活字不错反复使用上万次。这大幅裁减了 DNA 存储的老本,也提高了存储恶果。

结语

从雕版到活字,从纸张到 DNA,东说念主类纪录与储存信息的方式正在阅历一场起始千年的演变。在现时大数据时期,咱们不再知足于存储容量的慢慢擢升,而是驱动念念索:能否将数据存储进 DNA 之中?

毕昇一号借助 DNA 活字的立异样式,幸免了反复合成的奋斗老本,在恶果和老本上取得了新的冲破,展现了 DNA 存储期间的巨大后劲。跟着期间的进一步发展,大概在昔时,咱们的海量数据果然能被"写入" DNA,以生命的方式竣事起始时空的保存。

参考文献

[ 1 ] Wang C, Wei D, Wei Z, et al. Cost ‐ Effective DNA Storage System with DNA Movable Type [ J ] . Advanced Science, 2025, 12 ( 9 ) : 2411354.

[ 2 ] A. Wright, Worldwide IDC Global DataSphere Forecast, 2024 – 2028: AI Everywhere, But Upsurge in Data Will Take Time, International Data Corporation, IDC Corporate 140 Kendrick Street Building B, Needham, MA 02494 2024.

[ 3 ] Van Der Valk T, Pe č nerov á P, D í ez-del-Molino D, et al. Million-year-old DNA sheds light on the genomic history of mammoths [ J ] . Nature, 2021, 591 ( 7849 ) : 265-269.

洽商制作

出品丨科普中国

作家丨王琛 中国科学院狡计期间辩论所

监制丨中国科普博览

责编丨一诺

审校丨徐来、张林林

本文封面图片及文内图片来自版权图库

转载使用可能激勉版权纠纷

原创图文转载请后台恢复"转载"

点亮"推选"

一皆涨学问!

开云体育(中国)官方网站

上一篇:开yun体育网世界都会很当然地澌灭带鸡屎的-开云(中国大陆)kaiyun网页版登录入口
下一篇:欧洲杯体育这等于咱们的坐骨结节-开云(中国大陆)kaiyun网页版登录入口