A legjelentősebb MI-kutatási eredmények rendszeres összefoglalói — vezető konferenciák, folyóiratok és kutatóintézetek publikációinak elemzése és kontextualizálása.
Az alábbiakban a 2025 első negyedévének legjelentősebb MI-kutatási publikációit és fejlesztéseit foglaljuk össze az NeurIPS, ICML, ICLR és Nature konferenciákról és folyóiratokból.
A MoE (Mixture of Experts) architektúrák lehetővé teszik, hogy trillion-paraméteres modellek csak a releváns paraméter-alcsoportot aktiválják egy-egy bemenetre, drasztikusan csökkentve a számítási igényt a hagyományos dense modellekhez képest.
Az OpenAI GPT-4o modell benchmark-eredményei mutatják az első széleskörűen alkalmazható, emberi szintű valós idejű multimodális feldolgozást: szöveg, kép, hang egységes kezelését szinte nulla késleltetéssel.
A Figure-01 és Boston Dynamics robotok legújabb demonstrációi a fizikai MI kihívásait mutatják be: hogyan általánosíthatók a szöveges-vizuális nagy modellek tapasztalatai fizikai manipulációs feladatokra.
A Constitutional AI és a Scalable Oversight megközelítések a hagyományos emberi visszajelzés alapú tanítás (RLHF) korlátain túlmutató megoldásokat kínálnak az MI-rendszerek emberi értékekhez igazítására.
A Microsoft Phi-3-mini (3,8 milliárd paraméter) benchmark-eredményei meggyőzőek: a szintetikus, gondosan szerkesztett tanítóadatokon képzett kis modellek a 10-20-szoros méretű modelleket is megelőzik számos feladatban.
Az OpenAI Sora és a Google Veo modellek a videógenerálás területén hasonló ugrást hoztak, mint amit a képgenerálásban a Stable Diffusion és Midjourney jelentett 2022-ben. A szintetikus videótartalmak detektálásának kihívásai kritikus kutatási iránnyá válnak.