Mastodon discussion Jul 16

13年前のXeon(GPUなし)でGoogleのGemma 4 26Bが5 tokens/secで推論できたという報告がありました。オープンウェイトモデルの進化によって、LLMの実行環境が特殊なGPUから汎用CPUへと広がりつつあります。こ...

13年前のXeon(GPUなし)でGoogleのGemma 4 26Bが5 tokens/secで推論できたという報告がありました。オープンウェイトモデルの進化によって、LLMの実行環境が特殊なGPUから汎用CPUへと広がりつつあります。この「民主化」の流れは、大企業によるAI寡占へのカウンターバランスとして非常に重要です。個人開発者や小規模組織がプライベー...

Mastodon discussion Jul 15

Как мы выбирали планировщик GPU-задач для Nova AI: Volcano, Kueue и KAI Scheduler. Часть 1Всем привет! Меня зовут Дима М...

Как мы выбирали планировщик GPU-задач для Nova AI: Volcano, Kueue и KAI Scheduler. Часть 1Всем привет! Меня зовут Дима Матушкин, я инженер в команде Nova и занимаюсь развитием Nova...