AI обнулил benchmark и пытался шантажировать инженера. И почему это решаемоТоповые AI-модели с 95% на SWE-bench показывают 0% и 3% на ProgramBench бенчмарке, где задачи специально не пересекаются с обучающей выборкой. Не «упали на десять пунктов» - обнулились. Параллельно: в мае 2025 Anthropic опубликовали safety-эксперимент, где Claude Opus 4 в 84-96% случаев пытался шантажировать инженера приватной перепиской, чтобы избежать отключения. В мае 2026 они же выпустили разбор причин и инженерное решение - production-модели на этом тесте теперь 0%. Две истории, одна структура: модель предсказуема в обучающем распределении и непредсказуема за его пределами. Это не «AI плох» - это инженерная задача со своими правилами, и у нее есть решение. Глава 4 серии «Путь разработчика», вторая часть про границы AI в проде. Что я переделал в Lexis после двух разборов - внутри. Читать разборhttps://habr.com/ru/articles/1039358/#AIагенты #llm #anthropic #Claude #ProgramBench #Agentic_misalignment #Бенчмарк...
Related
Now #Amazon is caught scanning rare old books to feed #AI and destroying them in the process https://www.404media.co/we-...
Now #Amazon is caught scanning rare old books to feed #AI and destroying them in the process https://www.404media.co/we-tracked-a-shipment-of-rare-books-it-ended-at-an-amazon-ai-tr...
LS Electric wins $34m Bloom Energy data center dealSource: The Korea Herald Technologyhttps://www.koreaherald.com/articl...
LS Electric wins $34m Bloom Energy data center dealSource: The Korea Herald Technologyhttps://www.koreaherald.com/article/10844059#AI
#LG #xboomPower brings powerful #speakers, #karaoke #AI and smart #audio technologieshttps://gadgetflux.eu/lg-xboom-powe...
#LG #xboomPower brings powerful #speakers, #karaoke #AI and smart #audio technologieshttps://gadgetflux.eu/lg-xboom-power-noua-serie-de-difuzoare/