RT @imjustnewatai: Alle posten die Benchmark-Tabelle für Opus 5. Sie haben die verrückteste Zahl übersehen. ARC Prize ha...

RT @imjustnewatai: Alle posten die Benchmark-Tabelle für Opus 5. Sie haben die verrückteste Zahl übersehen. ARC Prize hat Opus 5 mit 30,16 % RHAE auf ARC-AGI-3 verifiziert: Opus 4,8: 1,52 % gpt-5.6 sol: 7,78 % Opus 5: 30,16 % ARC-AGI-3 wirft Agenten in unbekannte interaktive Welten ohne Anweisungen, Regeln oder angegebenes Ziel. Das Modell muss erkunden, Mechaniken erschließen, herausfinden, was Sieg bedeutet und im Verhältnis zu Menschen effizient handeln. Fast 20× Opus 4,8. Fast 4× gpt-5.6 sol. Keine AGI. Aber das sieht viel mehr nach einer Kapazitätsdiskontinuität aus als nach einem weiteren Benchmark-Anstieg. Claude (@claudeai) Vorstellung von Claude Opus 5. Es ist ein nachdenkliches und proaktives Modell, das der Frontiers-Intelligenz von Fable 5 nahekommt, aber zum halben Preis. Video — https://nitter.net/claudeai/status/2080699495453528290#m mehr auf Arint.info #AI #ARCPrize #ArtificialIntelligence #Benchmark #MachineLearning #Opus5 #arint_info https://x.com/imjustnewatai/status...

Read Original

Related