
材料科學(xué)的進(jìn)步,很大程度上取決于我們能否更快地找到性能更優(yōu)的物質(zhì)。鋰離子電池需要更高容量的正極,化工行業(yè)需要更具選擇性的催化劑......這些需求背后有一個共同約束:新材料的發(fā)現(xiàn)周期太長了。傳統(tǒng)研究流程以月或年為單位,而理論上可能存在的晶體結(jié)構(gòu)數(shù)量遠(yuǎn)超任何實驗室的篩選能力。這種張力,正是過去十年 AI 大規(guī)模介入材料科學(xué)的根本驅(qū)動力,推動材料研發(fā)智能化轉(zhuǎn)型。
近期由首爾大學(xué)與 KAIST 研究人員聯(lián)合發(fā)表于《Chemical Reviews》“化學(xué)人工智能” 特刊的綜述《AI for Accelerated Materials Discovery: From Generative Design to Autonomous Realization》,系統(tǒng)梳理了這一轉(zhuǎn)型過程的技術(shù)脈絡(luò),覆蓋從生成模型、物理啟發(fā)學(xué)習(xí)、基礎(chǔ)模型到合成規(guī)劃與自驅(qū)動實驗室的完整技術(shù)圖譜,以下分享按原文結(jié)構(gòu)逐節(jié)展開,并對第 7 節(jié)內(nèi)容——面向材料創(chuàng)制的 AI:合成規(guī)劃與自驅(qū)動實驗室進(jìn)行重點解讀。


01 范式轉(zhuǎn)變的輪廓
材料發(fā)現(xiàn)是化學(xué)、物理和工程交叉領(lǐng)域的一項基本挑戰(zhàn)。設(shè)計具有所需性能的新材料,支撐著能源轉(zhuǎn)換與存儲、催化、微電子和可持續(xù)發(fā)展等領(lǐng)域的進(jìn)步,然而,巨大的化學(xué)空間,加上復(fù)雜的結(jié)構(gòu)-性能-加工關(guān)系,意味著傳統(tǒng)的試錯方法已無法跟上當(dāng)前的需求。
高通量篩選(HTS)雖然加速了對大型候選庫的評估,但其根本上是基于預(yù)定義的化學(xué)空間進(jìn)行操作,將探索限制在已枚舉的范圍內(nèi),而非可以設(shè)計的范圍。在此背景下,材料信息學(xué)早期依靠手動設(shè)計的描述符和固定的篩選庫,試圖將經(jīng)驗直覺和領(lǐng)域知識形式化。機(jī)器學(xué)習(xí)(ML)技術(shù)的出現(xiàn)為這一工作流程帶來了部分自動化,但大多數(shù)傳統(tǒng) ML 模型是在狹窄數(shù)據(jù)集上訓(xùn)練的,在其適用域之外表現(xiàn)不佳。這些模型通常將材料設(shè)計、合成規(guī)劃和實驗驗證的核心任務(wù)視為孤立的階段,導(dǎo)致效率低下,且缺乏整個發(fā)現(xiàn)循環(huán)中的反饋整合。
近年來,多個 AI 范式共同改變了這一格局。首先,生成模型實現(xiàn)了逆向設(shè)計——直接從目標(biāo)性能需求出發(fā)生成候選材料,而不是從固定候選結(jié)構(gòu)集中篩選。VAE、GAN、擴(kuò)散模型、貝葉斯流網(wǎng)絡(luò)、基于流的架構(gòu)和自回歸架構(gòu)等模型,已被證明能夠?qū)W習(xí)材料空間的關(guān)鍵信息,并利用這些關(guān)鍵信息生成符合特定性能要求的新候選結(jié)構(gòu)。
其次,基礎(chǔ)模型源于材料科學(xué)打破專門任務(wù)之間壁壘的需求。這些大規(guī)模架構(gòu)在數(shù)百萬個結(jié)構(gòu)、實驗測量數(shù)據(jù)和科學(xué)文獻(xiàn)上進(jìn)行預(yù)訓(xùn)練,從而學(xué)習(xí)能在不同材料類別和屬性類型間遷移的關(guān)鍵數(shù)學(xué)描述。它們可將先前孤立的能力,如結(jié)構(gòu)生成、性能預(yù)測和合成規(guī)劃連接成統(tǒng)一的工作流。
當(dāng)與自主實驗相結(jié)合時,這一轉(zhuǎn)變會進(jìn)一步加速。自主實驗室集成了機(jī)器人合成、原位表征和 AI 驅(qū)動決策,創(chuàng)建了閉環(huán)發(fā)現(xiàn)系統(tǒng)。語言模型的可解釋推理能力促進(jìn)了與人類研究人員的協(xié)作,將黑箱優(yōu)化提升為上下文感知發(fā)現(xiàn)。
盡管如此,根本性局限仍然存在。材料數(shù)據(jù)庫偏向熱力學(xué)穩(wěn)定相,亞穩(wěn)態(tài)和無序結(jié)構(gòu)代表性不足。為應(yīng)對這些挑戰(zhàn),物理啟發(fā)的神經(jīng)網(wǎng)絡(luò)和對稱性感知架構(gòu)直接編碼領(lǐng)域知識,即使在數(shù)據(jù)有限的條件下也能實現(xiàn)穩(wěn)健預(yù)測。
本綜述聚焦于通過連接候選生成、可遷移表示學(xué)習(xí)、數(shù)據(jù)基礎(chǔ)設(shè)施、合成規(guī)劃和實驗實現(xiàn)來加速材料發(fā)現(xiàn)的 AI 方法,重點關(guān)注無機(jī)晶體材料領(lǐng)域的研究。下圖展示了這一演變的代表性概覽,從理論引導(dǎo)篩選到預(yù)測性機(jī)器學(xué)習(xí)、早期深度生成模型,以及先進(jìn)生成模型和基礎(chǔ)模型。底部箭頭突出了從篩選現(xiàn)有候選到設(shè)計定制候選的廣泛轉(zhuǎn)變。

圖 1 計算和 AI輔助材料發(fā)現(xiàn)范式的演變。示意圖說明了材料發(fā)現(xiàn)發(fā)展的代表性、非窮舉階段:(i)2000 年代的理論/模擬引導(dǎo)篩選,包括DFT計算和基于描述符的篩選,用于基于物理的候選評估和實驗指導(dǎo);(ii)2010 年代的預(yù)測性機(jī)器學(xué)習(xí),包括性能預(yù)測代理模型、主動學(xué)習(xí)和貝葉斯優(yōu)化,用于快速預(yù)測和候選優(yōu)先排序;(iii)2010 年代末至2020年代初的早期深度生成模型,包括 VAE、GAN 和強化學(xué)習(xí),用于學(xué)習(xí)材料分布和提出新候選;以及(iv)2020 年代的先進(jìn)生成模型和基礎(chǔ)模型,包括擴(kuò)散、流、BFN、Transformer 和基于 LLM 的方法,用于條件生成和閉環(huán)材料發(fā)現(xiàn)。底部箭頭突出了從篩選現(xiàn)有候選到設(shè)計定制候選的廣泛轉(zhuǎn)變。

02 逆向材料設(shè)計的生成模型
過去材料發(fā)現(xiàn)主要靠三類方法:化學(xué)直覺、物理理論與模擬、以及高通量計算加機(jī)器學(xué)習(xí)篩選。這個流程越來越高效,但本質(zhì)上大多還是在已知的結(jié)構(gòu)里挑選候選化合物。生成模型帶來的變化是:不只是評估候選,而是能主動提出新的結(jié)構(gòu)和組成,相當(dāng)于把找材料從理論引導(dǎo)篩選 + 預(yù)測模型轉(zhuǎn)向生成式逆向設(shè)計。
生成式模型的發(fā)展歷經(jīng)了三個階段:
第一階段是 VAE 和 GAN 這類早期生成模型,證明了 AI 確實可以生成新材料候選結(jié)構(gòu),比如一些低能量、潛在穩(wěn)定的晶體結(jié)構(gòu),而不只是做性質(zhì)預(yù)測。但它們更多停留在概念驗證層面,原因在于材料問題容錯率非常低,一個直觀的對比是:在圖像生成中,改變幾個像素的顏色通常不會使圖像失效;但在晶體結(jié)構(gòu)中,哪怕一個原子的類型分配錯誤,整個結(jié)構(gòu)就可能變得不合理。VAE 在復(fù)雜分布建模上有局限, GAN 又容易訓(xùn)練不穩(wěn)定,所以很難穩(wěn)定產(chǎn)出高質(zhì)量候選。
第二階段出現(xiàn)了更強的生成框架,比如擴(kuò)散模型、流匹配方法和貝葉斯流網(wǎng)絡(luò)。它們在生成質(zhì)量和效率上更進(jìn)一步,尤其針對晶體這種受強物理約束的對象。研究開始把周期性、對稱性、晶格參數(shù)、分?jǐn)?shù)坐標(biāo)等硬約束條件更系統(tǒng)地放進(jìn)模型里,這樣做的核心思路是讓模型在化學(xué)規(guī)則內(nèi)創(chuàng)新。
第三階段是基于文本的自回歸路線和 LLM 路線。簡單來說,就是把晶體轉(zhuǎn)成序列,讓模型像寫句子一樣逐步生成結(jié)構(gòu)。代表思路包括專門的晶體 token 設(shè)計,以及用 LLM 先生成再精煉結(jié)構(gòu)。這條路線的優(yōu)勢是可擴(kuò)展,能借到大模型在序列建模上的能力。但難點是晶體表示有非唯一性:同一個結(jié)構(gòu)可能有多種寫法,因此需要更規(guī)范的表示和專門的 token 化方案。
生成模型不是要替代傳統(tǒng)材料研發(fā)流程,而是作為其中一個關(guān)鍵模塊,負(fù)責(zé)拓展候選空間、加快提出新假設(shè)。真正決定價值的,仍然是后續(xù)驗證鏈條,包括化學(xué)合理性、熱力學(xué)穩(wěn)定性、可合成性以及實驗驗證。所以未來重點不是討論誰是唯一最強模型,而在多種模型協(xié)同 + 物理約束注入 + 實驗閉環(huán)驗證。

圖 2 用于無機(jī)材料生成的擴(kuò)散模型。圖中展示了(a)CDVAE、(b)DiffCSP 和(c)MatterGen 的架構(gòu)與擴(kuò)散過程,它們是用于無機(jī)晶體生成的基礎(chǔ)性生成框架。

03 物理/化學(xué)啟發(fā)的數(shù)據(jù)高效AI
過去十年,材料信息學(xué)進(jìn)步很快,一個重要原因是有了更多數(shù)據(jù)和更強算力。很多模型在大數(shù)據(jù)條件下表現(xiàn)很好。但材料領(lǐng)域的高質(zhì)量數(shù)據(jù)并不容易獲得:實驗慢、成本高,高精度計算也很貴。也就是說,我們不能一直靠數(shù)據(jù)越多越好這條路。真正的挑戰(zhàn)是在小樣本、貴樣本條件下,依然做出可靠預(yù)測和高效發(fā)現(xiàn)。
在這一過程中,整體發(fā)展的第一階段是典型的大數(shù)據(jù)驅(qū)動方法,主要依賴統(tǒng)計相關(guān)性,優(yōu)點是上手快、效果直觀,但缺點是對數(shù)據(jù)量依賴強,遇到分布外樣本容易失效。
第二階段開始將物理和化學(xué)知識以歸納偏置的形式嵌入模型架構(gòu),而非僅僅依賴數(shù)據(jù)量。把守恒關(guān)系、對稱性、結(jié)構(gòu)約束、元素規(guī)則等先驗信息融入模型,這樣做的好處是,模型搜索空間變小了,學(xué)習(xí)效率更高,也更符合科學(xué)規(guī)律。
第三階段轉(zhuǎn)向 “數(shù)據(jù)高效學(xué)習(xí)” 策略,比如遷移學(xué)習(xí)、小樣本學(xué)習(xí)、多保真建模和主動學(xué)習(xí)。主動學(xué)習(xí)尤其關(guān)鍵:模型不再被動吃數(shù)據(jù),而是主動挑最值得做的下一個實驗或計算,從而用更少成本換更多有效信息。
第四階段則是把模型與實驗平臺連接起來,形成 “預(yù)測—實驗—反饋—再預(yù)測” 的閉環(huán),讓材料研發(fā)從線性流程變成迭代優(yōu)化流程。
材料 AI 的競爭重點正在變化,不再是簡單比誰數(shù)據(jù)多、模型大,而是比誰更好地把機(jī)理知識與數(shù)據(jù)驅(qū)動結(jié)合起來。未來最有前景的路線是 “物理/化學(xué)先驗 + 數(shù)據(jù)高效算法 + 主動決策 + 實驗閉環(huán)” 協(xié)同推進(jìn)。評價一個方法的價值,也不能只看離線指標(biāo),而要看它是否真正減少實驗次數(shù)、降低研發(fā)成本、縮短發(fā)現(xiàn)周期,并最終找到可合成、可驗證、可應(yīng)用的材料。

04 基礎(chǔ)模型與預(yù)訓(xùn)練
如何實現(xiàn)材料AI的快速泛化
傳統(tǒng)材料 AI 通常是一個任務(wù)對應(yīng)一個模型,比如預(yù)測帶隙訓(xùn)練一個模型,預(yù)測穩(wěn)定性再訓(xùn)練一個模型。這種方式能解決局部問題,但缺點也很明顯,重復(fù)開發(fā)成本高,依賴大量標(biāo)注數(shù)據(jù),換任務(wù)或換材料體系時往往要從頭開始。基礎(chǔ)模型的出現(xiàn),就是為了解決這個瓶頸。基礎(chǔ)模型是近年來 AI 領(lǐng)域最重要的趨勢之一,在材料科學(xué)中也開始落地。它的核心思路是:先在大規(guī)模、多來源數(shù)據(jù)上預(yù)訓(xùn)練通用能力,學(xué)習(xí)可遷移的表示,然后以少量標(biāo)注數(shù)據(jù)適應(yīng)各種下游任務(wù)。
材料科學(xué)的一個特殊性在于信息的多樣性。一個材料的完整描述往往涉及晶體結(jié)構(gòu)、電子能帶、XRD 圖譜、合成配方、文獻(xiàn)敘述等多種模態(tài)。傳統(tǒng)的做法是為每種模態(tài)設(shè)計專門的模型,但這割裂了信息之間的內(nèi)在關(guān)聯(lián)。多模態(tài)基礎(chǔ)模型試圖解決這一問題,將晶體結(jié)構(gòu)、態(tài)密度、電荷密度和文本描述通過對比學(xué)習(xí)對齊到共享空間,實現(xiàn)了跨模態(tài)檢索與預(yù)測。材料 AI 正在從單模態(tài)走向多模態(tài),逐步接近研究者實際處理信息的方式。

圖 5 材料科學(xué)中基礎(chǔ)模型的概念框架,重點關(guān)注多模態(tài)基礎(chǔ)模型(MFMs)。(左)多模態(tài)數(shù)據(jù)的整合,包括結(jié)構(gòu)信息、文本信息和視覺信息,用于大規(guī)模預(yù)訓(xùn)練。(中)預(yù)訓(xùn)練將不同模態(tài)映射至共享表示空間,以捕捉潛在的物理關(guān)系及模態(tài)間的依賴關(guān)系。(右)將MFM適應(yīng)于各類下游任務(wù),如屬性預(yù)測和逆向設(shè)計,并可拓展至跨模態(tài)任務(wù),包括自動表征與合成規(guī)劃。
基礎(chǔ)模型的價值在于可遷移、可復(fù)用、可擴(kuò)展。它能顯著減少重復(fù)建模,縮短研發(fā)迭代周期。但它并不是萬能的,要真正用于材料發(fā)現(xiàn),還必須同時解決四個問題:
第一,訓(xùn)練數(shù)據(jù)質(zhì)量與偏差;
第二,評估標(biāo)準(zhǔn)統(tǒng)一和公平比較;
第三,模型與物理化學(xué)規(guī)律的一致性;
第四,與實驗系統(tǒng)形成快速反饋閉環(huán)。

以上四節(jié)勾勒了當(dāng)前 AI 在材料發(fā)現(xiàn)中的主要進(jìn)展:生成模型使逆向設(shè)計成為可能,物理啟發(fā)學(xué)習(xí)提升了數(shù)據(jù)利用效率,基礎(chǔ)模型提供了可遷移的表示能力。這些方法的核心貢獻(xiàn)在于拓展了候選材料的搜索空間,并縮短了性能預(yù)測的時間尺度。
然而,從計算方法輸出的一個合理結(jié)構(gòu)到實驗室中真實存在的化合物,其間仍有相當(dāng)距離。接下來的第 5 至第 8 節(jié),將把視角從計算設(shè)計轉(zhuǎn)向?qū)嶒瀸崿F(xiàn)。具體而言,第 5 節(jié)討論大語言模型驅(qū)動的 AI 智能體如何協(xié)調(diào)多步科學(xué)任務(wù);第 6 節(jié)審視材料數(shù)據(jù)庫在數(shù)據(jù)質(zhì)量、偏差和標(biāo)準(zhǔn)化方面的現(xiàn)狀與挑戰(zhàn);第 7 節(jié)聚焦于 AI 輔助的合成規(guī)劃與自主實驗室,分析從前驅(qū)體推薦到閉環(huán)實驗優(yōu)化的技術(shù)路徑及當(dāng)前瓶頸;第 8 節(jié)則給出整體總結(jié)與展望。
這些議題共同指向一個更為復(fù)雜的現(xiàn)實:材料的可設(shè)計性與可合成性之間并非天然完美對接,而如何彌合這一間隙,正是下篇要討論的重點。技術(shù)變革的張力,往往正藏于這些未完成之處。精彩仍在延續(xù),下周四,我們繼續(xù)深入拆解......
文獻(xiàn)原文:
https://pubs.acs.org/chreay/article/126/15/8644/5238567/AI-for-Accelerated-Materials-Discovery-From?searchresult=1
聲明:
本文所有內(nèi)容旨在學(xué)術(shù)探討與信息交流,所有權(quán)利歸原作者所有。
聯(lián)系人:晶泰科技
郵箱:bd@xtalpi.com
電話:021-68780786
地址:深圳市福田區(qū)福保街道福保社區(qū)紅柳道2號國際生物醫(yī)藥產(chǎn)業(yè)園二期1層
晶泰科技服務(wù)號
晶泰智造公眾號
©2026 深圳晶泰科技有限公司 版權(quán)所有 備案號:粵ICP備17120953號 技術(shù)支持:化工儀器網(wǎng) Sitemap.xml 總訪問量:129606 管理登陸