Топ вопросов с NLP собеседований: архитектуры LLM, инференс и оптимизацияНа NLP/LLM собеседованиях все чаще проверяют не только знание трансформеров, но и понимание того, как устроены современные GPT-like модели: почему большинство генеративных LLM используют decoder-only архитектуру, чем LLaMA отличается от ванильного Transformer, зачем нужны RoPE, RMSNorm, SwiGLU и GQA. Почему инференс LLM дорогой и какие оптимизации помогают его ускорять: fused kernels, FlashAttention, KV-cache и PagedAttention, continuous batching, speculative decoding, квантизация и дистилляция. Много схем и картинок, а также полный список вопросов с собесов в конце.https://habr.com/ru/articles/1068944/#LLM #архитектура_LLM #инференс_LLM #ускорение_LLM #оптимизация_LLM #Transformer #FlashAttention #KVcache #квантизация_LLM #Mixture_of_Experts
Related
The other Sean Byrne doesn't existArticle URL: https://conic.al/writing/the-other-sean-byrne-doesnt-exist/ Comments URL:...
The other Sean Byrne doesn't existArticle URL: https://conic.al/writing/the-other-sean-byrne-doesnt-exist/ Comments URL: https://news.ycombinator.com/item?id=49307592 Points: 8 # C...
ははっ、iOSですかiOS 27/iPadOS 27:Spotlightを使って検索でSiriからのアプリ提案を非表示可能に https://www.macotakara.jp/category-54/entry-51627.html#Ap...
ははっ、iOSですかiOS 27/iPadOS 27:Spotlightを使って検索でSiriからのアプリ提案を非表示可能に https://www.macotakara.jp/category-54/entry-51627.html#Apple #LLM #news #bot
"Deep Unlearning": Timnit Gebru on AI Hype, Ethics & Algorithmic Racial BiasDemocracy Now!#google #AI #News #bias https:...
"Deep Unlearning": Timnit Gebru on AI Hype, Ethics & Algorithmic Racial BiasDemocracy Now!#google #AI #News #bias https://youtu.be/aCB-NQtsKrs?si=gBTZtmNxObMcIdW4