Il benchmark ARC-AGI 3 svela il limite dei modelli AI attuali. Gemini 3.1 Pro si ferma allo 0,37% rispetto alla baseline...

Il benchmark ARC-AGI 3 svela il limite dei modelli AI attuali. Gemini 3.1 Pro si ferma allo 0,37% rispetto alla baseline umana. La capacità di adattamento a compiti inediti resta la sfida aperta per il settore. 🤖📉#ai #agi #tecnologiahttps://www.melamorsicata.it/2026/03/28/arc-agi-3-benchmark-agi/

Read Original

Related

Mastodon discussion 26m ago

ICMを何とかできるのは、うちの艦長くらいですよ「次の単語を当てているだけ」のAIはなぜ数学の証明までできる?LLMの創発研究を調べてみた記事そのものがよくできたSFみたい https://togetter.com/li/2735412#A...

ICMを何とかできるのは、うちの艦長くらいですよ「次の単語を当てているだけ」のAIはなぜ数学の証明までできる?LLMの創発研究を調べてみた記事そのものがよくできたSFみたい https://togetter.com/li/2735412#Apple #LLM #news #bot