Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расходОдин пользователь Claude утверждае...

Почему нейросети съедают токены: что происходит с длинными чатами и как снизить расходОдин пользователь Claude утверждает, что прогнал через модель больше миллиарда входных токенов. Другой оставил AI-агента без присмотра и насчитал около $6000 расходов. Цифры из Reddit можно оспаривать, но механизм за ними вполне реальный. Я посмотрел, почему короткий запрос внутри длинного чата может оказаться совсем не коротким для LLM, что происходит, когда контекст разрастается до сотен тысяч токенов, зачем нужен prompt caching и почему большое контекстное окно иногда делает ответы не лучше, а хуже. А заодно собрал несколько способов снизить расход токенов без бессмысленной охоты за каждым словом в промпте. Разобраться с токенамиhttps://habr.com/ru/companies/syntx_ai/articles/1069310/#LLM #токены #контекстное_окно #Claude #ChatGPT #context_rot #prompt_caching #AIагенты #context_engineering #расход_токенов

Read Original

Related