Malzeme biliminde atomik ölçekteki enerji hesaplamaları için altın standart sayılan yoğunluk fonksiyonel teorisi (DFT), aynı malzemeyi farklı ayarlarla hesapladığınızda birbirinden belirgin biçimde ayrışan sonuçlar verebiliyor. Kullanılan takas-korelasyon fonksiyoneli, kinetik enerji eşik değerleri, sözde potansiyeller ve dispersiyon düzeltmeleri gibi parametreler, atom başına onlarca ila yüzlerce mili-elektron voltluk sistematik sapmalar yaratıyor.

Bu sorunu somutlaştıran en iyi örnek MatPES veri tabanı: Aynı kristal yapılar, yaygın kullanılan PBE fonksiyoneli ile daha yeni r2SCAN fonksiyoneli arasında ortalama 107 meV/atom gibi kayda değer bir enerji farkı sergileyebiliyor. Kulağa küçük gelen bu rakam, malzeme kararlılığı tahminleri ve faz diyagramları gibi kritik hesaplamalar için önemli bir hata payı oluşturuyor.

Farklı laboratuvarlar ve projeler farklı DFT protokolleri kullandığından, bu birikimli veri zenginliğini tek bir yapay zeka modeli için bir araya getirmek son derece güç. Her kaynak kendi 'enerji dili'ni konuşuyor ve bu diller arasında güvenilir bir çeviri mevcut değildi; ta ki şimdiye kadar.

Yeni çalışmada araştırmacılar, bu metodolojik uçurumu kapatmak için graf sinir ağlarına başvurdu. MatPES'ten elde edilen 380.190 adet eşleştirilmiş PBE-r2SCAN kaydıyla eğitilen model, bir kristal yapının graf temsilini girdi olarak alıyor ve iki fonksiyonel arasındaki beklenen enerji artığını tahmin ediyor. Bu sayede PBE ile hesaplanmış bir veri noktası, r2SCAN eşdeğerine 'çevrilerek' ortak bir veri havuzuna dahil edilebiliyor.

Yaklaşımın özgünlüğü, yalnızca bir sayısal düzeltme uygulamak yerine yapının geometrik ve kimyasal özelliklerini de dikkate alarak her malzemeye özgü bir hizalama gerçekleştirmesinde yatıyor. Graf tabanlı temsil, atomlar arası bağları ve uzamsal düzeni kodlayarak fonksiyoneller arasındaki farkın neden kaynaklandığını dolaylı olarak öğreniyor.

Bu gelişme, malzeme keşfine yönelik büyük ölçekli yapay zeka modellerinin eğitimi açısından kritik bir adım. Farklı hesaplama protokollerinden gelen verilerin güvenle bir araya getirilmesi, hem eğitim veri setlerinin büyüklüğünü hem de çeşitliliğini artırarak daha sağlam ve genelleştirilebilir malzeme tahmin modellerinin geliştirilmesine zemin hazırlıyor.