19. ožujka Home je saznao iz službenog javnog prikaza WECHAT-a CAICT-a da je, kako bi se razumio status halucinacije velikih modela i promovirao detaljnu i praktičnu primjenu velikih modela, Institut za umjetnu inteligenciju iz CAICT-a pokrenuo test velikog modela halucinacije na temelju prethodnog rada AI sigurnosnih rečenica.
Hallucinacija velikog modela (AI halucinacija) odnosi se na sadržaj koji se čini razumnim kada model generira sadržaj ili odgovara na pitanja, ali zapravo nije u skladu s unosom korisnika (halucinacija Fidelity) ili u skladu s činjenicama (činjenična halucinacija). Uz široku primjenu velikih modela u ključnim područjima kao što su medicina i financije, potencijalni rizici primjene koje donosi veliki model halucinacije povećavaju se i primaju široku pažnju iz industrije.

Ovaj krug testiranja halucinacije koristit će velike jezične modele kao testni objekt, koji pokrivaju dvije vrste halucinacija: činjenične halucinacije i vjerne halucinacije. Specifični sustav evaluacije je sljedeći:
Testni podaci sadrže više od 7, 000 kineske testne uzorke. Format testa uključuje dvije vrste pitanja: vađenje informacija i rasuđivanje znanja koji odgovaraju otkrivanju vjerne halucinacije i činjenica o diskriminaciji koja odgovaraju činjeničnoj otkrivanju činjenične halucinacije. Općenito, uključuje pet dimenzija testa: humanističke znanosti, društvene znanosti, prirodne znanosti, primijenjene znanosti i formalne znanosti.
Kineska akademija za informacijske i komunikacijske tehnologije poziva relevantne tvrtke da sudjeluju u evaluaciji modela i zajednički promoviraju sigurnu primjenu velikih modela.
