[Перевод] Масштабирование LLM: от одного чипа до ЦОДа. Глава 4. Тренировка трансформераНаконец-то мы добрались непосредственно до того, как тренировать трансформер, не просто тренировать, а делать это эффективно и масштабируемо. Как мы уже знаем из прошлых глав, трансформер штука тяжелая и на один ускоритель обычно не влезает, поэтому цель масштабирования состоит в том, чтобы распихать тренировку модели по нескольким ускорителям, и желательно при этом, чтобы производительность и пропускная способность такой системы росли пропорционально количеству ускорителей в ней. А этого добиться довольно сложно, просто потому что чем больше ускорителей в системе, тем сложнее и накладнее передавать данные между частями системы и все это дело синхронизировать. Как мы видели в одной из предыдущих глав про шардинг матричных операций , распределенное матричное умножение требует разных дополнительных операций вроде AllGather или ReduceScatter, которые занимают шину данных и тратят процессорное время. В о...
Related
Using GCC's Nested Functions with Wide Pointers and No Trampolines IIArticle URL: https://uecker.codeberg.page/2026-07-1...
Using GCC's Nested Functions with Wide Pointers and No Trampolines IIArticle URL: https://uecker.codeberg.page/2026-07-14.html Comments URL: https://news.ycombinator.com/item?id=49...
All kinds of statistics and whatnot…. #brexit #BrexitLies #politics #toryscum #tories #conservatives #ukpolitics #bbc #n...
All kinds of statistics and whatnot…. #brexit #BrexitLies #politics #toryscum #tories #conservatives #ukpolitics #bbc #news #EU #Labour #labourparty #RejoinEU #TaxTheRich #usa #usp...
🧠 AI systems perform better at mathematics tasks by leveraging vast pattern recognition and stored information rather th...
🧠 AI systems perform better at mathematics tasks by leveraging vast pattern recognition and stored information rather than by developing superior reasoning capabilities. The distin...