Честный RAG eval set: как собрать первые 100-300 кейсов и не обмануть себя цифройВ прошлой статье серии мы сжимали эмбеддинги и замеряли, насколько изменится выдача относительно полного fp32-поиска. Там это был правильный вопрос: ломает ли квантизация уже существующий retrieval . Но у такого замера есть неприятное слепое пятно. Можно аккуратно сохранить 99% выдачи исходного эмбеддера и все равно плохо находить нужные документы на своем домене. Внешний бенчмарк, даже сильный, этого не гарантирует. BEIR как раз был создан, чтобы показать, насколько результаты retrieval меняются между разными задачами и доменами; один усредненный скор там не заменяет проверку на собственных данных. Нужен свой eval set . И тут обычно возникает ложная развилка:https://habr.com/ru/articles/1070534/#rag #retrieval #evals #оценка_качества #LLM #эмбеддинги #поиск #MTEB #ragas #BEIR
Related
Used AI to improve a caption or correct the lighting in a photograph? That does not automatically mean your post needs a...
Used AI to improve a caption or correct the lighting in a photograph? That does not automatically mean your post needs an AI label.The EU's new rules are aimed more specifically at...
Avoid using #AI at all costs.
Avoid using #AI at all costs.
Discrete Fourier Transform by HandArticle URL: https://www.byhand.ai/p/28-discrete-fourier-transform Comments URL: https...
Discrete Fourier Transform by HandArticle URL: https://www.byhand.ai/p/28-discrete-fourier-transform Comments URL: https://news.ycombinator.com/item?id=49301342 Points: 5 # Comment...