Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расходОдин пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенамиhttps://habr.com/ru/companies/syntx_ai/articles/1069310/#LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов
Related
Wiwynn's NVIDIA SCADA prototype puts GPUs closer to storage, aiming to cut CPU I/O overhead in petabyte-scale AI racks. ...
Wiwynn's NVIDIA SCADA prototype puts GPUs closer to storage, aiming to cut CPU I/O overhead in petabyte-scale AI racks. A useful reminder that AI performance isn't just about accel...
A maker compressed a 2.9MB song by 1000x and printed it on paper as eight QR codes, requiring a neural network for playb...
A maker compressed a 2.9MB song by 1000x and printed it on paper as eight QR codes, requiring a neural network for playback.Source: Tom's Hardwarehttps://www.tomshardware.com/tech-...
@CharlieMcHenry Very true.Commodity businesses do not earn LARGE profits.But by the nature if being commodity, they earn...
@CharlieMcHenry Very true.Commodity businesses do not earn LARGE profits.But by the nature if being commodity, they earn HUGE profits.Paraphrasing "The key to riches is inventing s...