I expanded the #Vera benchmark to six models across three providers (Anthropic, OpenAI, Moonshot). Kimi K2.5 got every V...

I expanded the #Vera benchmark to six models across three providers (Anthropic, OpenAI, Moonshot). Kimi K2.5 got every Vera problem right while only managing 86% in Python and 91% in TypeScript. Across the flagship models, Vera and Python are level at 93%.Yet there is no Vera in any training data, no examples on GitHub or Stack Overflow. Every token generated from a single spec document in the prompt. Language design doing a lot of heavy lifting.https://veralang.dev#AI #LLM #Programming

Read Original

Related

Mastodon discussion 6m ago

أطلقت شركة ElevenLabs نموذج Eleven v3 Conversational الجديد، وهو نموذج كلام تعبيري مصمم للتطبيقات التي تعمل في الوقت الف...

أطلقت شركة ElevenLabs نموذج Eleven v3 Conversational الجديد، وهو نموذج كلام تعبيري مصمم للتطبيقات التي تعمل في الوقت الفعلي. يتميز هذا النموذج بقدرته على التحكم الدقيق في العواطف و...