Почему RAG — это не просто «добавить поиск»: latency, качество и выбор стратегии retrievalКогда говорят про RAG, его часто описывают как простой способ улучшить LLM‑систему: добавить поиск по внешним данным, найти релевантный контекст, передать его модели и получить более точный ответ. На уровне идеи это действительно выглядит логично. Но в реальной системе RAG — это не только способ обогатить ответ. Это отдельный операционный слой, который влияет на задержку, размер prompt, количество input tokens, стоимость запроса, качество ответа, SLA и требования к наблюдаемости системы. Я хотел посмотреть на это не в формате общих рассуждений, а на небольшом локальном стенде: где именно появляется дополнительная нагрузка, какие параметры сильнее всего влияют на latency, почему больше контекста не всегда означает лучшее качество и почему стратегия retrieval должна зависеть от типа вопроса и структуры данных. Это не промышленный benchmark и не попытка получить универсальные цифры. Скорее серия конт...
Related
“None of this has much to do with my feelings about #AI, and far more to do with basic mathematics. #OpenAI has no econo...
“None of this has much to do with my feelings about #AI, and far more to do with basic mathematics. #OpenAI has no economies of scale, it’s horribly-unprofitable, and does not have...
No nonsense AI Policy by Berkeley Law School. Universities, take note!“This policy seeks to ensure that our courses focu...
No nonsense AI Policy by Berkeley Law School. Universities, take note!“This policy seeks to ensure that our courses focus on requisite cognitive skills by default…by forbidding the...
Supacode packages Git worktrees into a Mac workspace for coding agents, but early metrics tell us little about actual us...
Supacode packages Git worktrees into a Mac workspace for coding agents, but early metrics tell us little about actual use. 2,295 GitHub stars and 7,673 Homebrew installs measure in...