Megduplázták a teljesítményüket a nagy nyelvi modellek az elmúlt hónapban

 Körülbelül egy hónapja, hogy a Scale AI közzétette az „Emberiség utolsó vizsgája” nevű tesztjének első eredményeit, amely a mesterséges intelligencia szakértői szintű tudását és érvelési képességeit hivatott mérni különböző területeken. Ezeken túlmenően a teszt a modellek kalibráltságát is méri. A teszt egyaránt érinti a reál és humán tudományokat, bár érthető okoknál fogva a reál tudományok azon belül is a matematika túlsúlyban van a többihez képest, hiszen leginkább ezzel kapcsolatban tudunk objektív igazságokat megfogalmazni.

Az első tesztelésekkor több fejlett modellt is végigfuttattak a teszten, olyanokat mint a OpenAI GPT-4o, az Anthropic Claude 3.5 Sonnet, vagy a DeepSeek R1. A modellek egyikének sem sikerült elérnie a 10%-so értéket, de az OpenAI o1 és a DeepSeek R1 nagyon közel voltak hozzá. Ami a kalibráltságot illeti, itt is jelentős ledolgozni való van még, hiszen magas kalibrációs hibák jelentkeztek, ami azt jelenti, hogy a modellek meglehetősen magabiztosan állítottak butaságokat.

Az első eredmények, vagy egyenesen kudarcok után sorra, jelentek meg a Deep Research funkciók a különböző modellekben. Ezek jellemzően optimalizált érvelési, adatelemzési és strukturált információfeldolgozási képességeket hoztak magukkal. Ahogy az várható volt eleinte fizetős modellekben bukkantak fel, de később sorra jelentek meg ingyenes verziók és a napokban a Perplexity AI is elérhetővé tette ingyenes chat felületén a Deep Research funkciót.  

Az
Az "Emberiség utolsó vizsgája" teszt eredményei

 A Deep Research-el felvértezett modellek ismét megpróbálkoztak az emberiség utolsó vizsgájával. Ennek eredményeképpen az OpenAI immár 26.6%-os eredménnyel került fel a dobogóra, de szorosan követi a Perplexity Deep Research 21.1%-os eredménnyel. Ez a fejlődés rövid időn belül hatalmas előrelépést jelent, de fontos megjegyezni, hogy nem minden modell tudott ekkora fejlődést felmutatni, ezért messze menő következtetéseket még nem érdemes levonni. A Center for AI Safety előrejelzése szerint egyes modellek az év végére haladhatják meg az 50%-os értéket.

Bár az „Emberiség utolsó vizsgája” fontos mérföldkő és kétségtelenül izgalmas betekintést nyújt a mesterséges intelligencia fejlődésébe, de nem az egyetlen szempont, amit figyelembe kell venni a modellek fejlesztésének értékelésekor. A valódi áttörés feltehetően a kreatív problémamegoldásban és a komplex, nyitott végű feladatok kezelésében rejlik majd. 

Osszd meg ezt a cikket
Lehet hogy hamarosan véget is ér az okostelefonok kora?
A napokban zajlik a Google trösztellenes pere, amelyen meghalgatták Eddy Cue-t az Apple szolgáltatásokért felelős vezető alelnökét. A tanúvallomás során Cue váratlan és izgalmas kijelentést tett, amelyben azt sugallta, hogy hamarosan az iPhone az iPod sorsára juthat.
Az Apple Anthropic-ra támaszkodva kíván saját „Vibe-Coding” platformot létrehozni
Az Apple számos nehézséggel nézett szembe az utóbbi időben saját mesterséges intelligencia megoldásainak kifejlesztése során, ezért talán nem meglepő, hogy a továbbiakban inkább külső AI-szakértelemre támaszkodna a további fejlesztések érdekében. Most úgy döntöttek, hogy az Anthropic-al egyesítik erőiket egy forradalmi „vibe-coding” szoftverplatform létrehozására, amely a generatív mesterséges intelligenciát használja fel a programozók kódjának írására, szerkesztésére és tesztelésére - derül ki a legfrissebb jelentésekből.
Megkezdődött a stablecoin forradalom
A Stripe megkezdte a fejlett világon kívüli országokban a stablecoin alapú fizetések tesztelését. A kezdeményezést a Bridge stablecoin platform felvásárlása előzte meg, amelyet a Coinbase korábbi vezetői Zach Abrams és Sean Yu alapítottak. A Stripe által alkalmazott stablecoin a dollár értékéhez van rögzítve, és elsősorban olyan vállalkozások számára kívánják megkönnyíteni a kifizetéseket vele, amelyek olyan országokban működnek, ahol a nemzeti valuta árfolyamának erős ingadozása, vagy egyéb infrastrukturális okok miatt a hagyományos valutákban való pénz mozgás rendkívül költséges.
QnodeOS az első kvantum operációs rendszer
A kvantumhálózatok eddig elérhetetlenül bonyolultnak tűntek a fejlesztők számára, hiszen minden hardvertípushoz külön szoftverréteg készült. Március közepén azonban a Quantum Internet Alliance (QIA) kutatócsoportja bejelentette a QNodeOS névre keresztelt kvantumoperációs rendszert, amely – a klasszikus világ operációs rendszereihez hasonlóan – elrejti a hardver alacsony szintű részleteit, és lehetővé teszi a magasabb szintű alkalmazások fejlesztését különböző kvantumprocesszorokon. Az első bemutatót a Nature online kiadványa közölte 2025. március 12-én, és azóta a QNodeOS gyorsan a kvantumhálózati kutatások középpontjába került.