Сообщество / ИИ

reranker включила — ответы стали хуже

masha_spb
Junior
Сообщения: 77
Репутация: 55
Дата регистрации:
11.08.2026
АВТОР ТЕМЫ06 сент. 2026 г., 01:09 (GMT+3)
Час ночи. На втором экране Open WebUI, на первом — папка с pdf, которые днём закинула в коллекцию. Чай уже холодный, замечаю только когда глоток получается странный. Вопрос тестовый, из тех что задают не задумываясь: за сколько дней сторона обязана уведомить о расторжении. Модель уверенно тащит приложение с банковскими реквизитами. Я сначала крутила температуру. Потом нарезала чанки помельче. Потом сняла семёрку и поставила qwen2.5 14b в q4 — стало медленнее, смысл тот же, реквизиты никуда не делись.

Дошло с третьего круга. На прошлой неделе включила reranker. В гайде было написано так, будто без него это не RAG, а «просто поиск». Корпус у меня небольшой: около двухсот договоров, регламенты, акты. Не тысячи документов и не поиск по всей вселенной. Выключила reranker, вернула 7b. Даже эмбеддинги не пересобирала — боялась, что ещё час подождёт. Ответ про уведомление снова из той статьи, из которой надо.

Если совсем просто: reranker — это вторая модель, которая пересортировывает куски, которые уже нашёл поиск. Когда документов мало, первый поиск и так вытаскивает нужные страницы. Вторая модель начинает «улучшать» и подтягивает соседний мусор — приложения, шапки, похожие формулировки из другого договора. Кажется, что модель глупая. Модель нормальная. Её попросили быть умной не в том месте.

На Heka я когда-то сразу поставила 14b. Не влезло спокойно, пошло в своп, ответы тянулись так, что проще открыть pdf руками. Перешла на Maat Pro, шестнадцать гигов — 14b в q4 живёт без истерик. Для поиска по своим текстам семёрки в q4 до сих пор хватает чаще, чем хочется признать тем, кто пишет «берите семидесятку, в кванте влезет». На восьми гигах 32b — это не «чуть помедленнее». Это вы сидите и смотрите, как своп доедает диск, и думаете, что сервер умер. Не обещайте себе 70b. Не влезет, и для договоров не надо.

Дальше уже не теория, а то, на чём я обожглась.

Pdf я режу по статьям и приложениям, не по двум тысячам символов слепо. В договорах нумерация врёт: пункт 5.3 в одном месте, а текст уехал в другой абзац из-за таблицы. Первые сто страниц пролистала глазами. Иначе потом вечно ловишь «модель не то нашла», хотя нашла она ровно то, что скормили кусками.

Для русского юртекста начинаю с qwen2.5 7b q4. Четырнадцать миллиардов имеет смысл, когда корпус разъехался и семёрка начинает путать договоры между собой. Не наоборот. И не агенты, не мультиагенты, не MCP своими руками. Open WebUI плюс Ollama, или AnythingLLM, если удобнее закидывать папки. Нужен поиск по своим pdf, чтобы младший не тащил договор в ChatGPT. Это единственная причина поднимать сервер. Если документы спокойно могут уехать наружу — подписка у OpenAI выйдет дешевле и быстрее, тут нечего доказывать. «ИИ заменит юристов» я в такие ночи перечитываю как анекдот: юриста как раз нельзя заменить тем, что утечёт.

Reranker на сотнях документов часто лучше не трогать. На тысячах и когда «находит не тот пункт» — тогда да, и даже тогда я бы сначала перепроверила нарезку. Не ставить сразу только потому что в гайде красивая схема.

11434 в мир не торчит. Туннель или хотя бы basic auth на webui, лучше оба. Не из чеклиста, из лени объяснять в понедельник чужие запросы в логе.

В докере один раз пересобрала webui «на минутку» и потеряла все загруженные pdf. Модели на месте, файлы нет. Теперь тома отдельно: для весов и для документов. Модели переживают пересоздание контейнера, загруженные файлы — нет.

С прошлым хостингом семёрка качалась раза в три дольше. Здесь 7b доехала, пока я ходила ставить чай, минут десять, не полчаса. Не в этом, конечно, дело. Дело в том, что после часа возни виноват был не размер модели, а галочка, которую я поставила «потому что так правильно».

Большая модель не лечит кривые чанки. Reranker не лечит маленький корпус. ChatGPT не лечит то, что договор нельзя никуда отправлять. Если пара сотен pdf и вопрос «какой пункт» — начните с 7b без reranker и посмотрите глазами, что именно попадает в контекст. Если там уже мусор, чините нарезку, а не покупайте 32b.

А у кого-то reranker на небольшом корпусе реально помог, не «стало вроде умнее»? Интересно не бенчмарк, а живые документы.
1
void_3am
Junior
Сообщения: 71
Репутация: 36
Дата регистрации:
14.08.2026
06 сент. 2026 г., 02:06 (GMT+3)

masha_spb писал:
Модель уверенно тащит приложение с банковскими реквизитами


в два часа reranker решил что реквизиты важнее срока. я бы тоже так подумал)
0
tema_py
Junior
Сообщения: 58
Репутация: 42
Дата регистрации:
18.08.2026
06 сент. 2026 г., 12:24 (GMT+3)
void_3am я б тоже купился)) гонял бота по своим pdf, в логе reranker поднимает приложение с инн выше абзаца про срок. сначала подумал эмбеддинги кривые. выкинул reranker из пайплайна, оставил top-k — 7b снова нормально отвечает. на мелком корпусе он только секунды жрёт, у кого-то на боте наоборот зашло?
3
gleb_tomsk
Junior
Сообщения: 54
Репутация: 35
Дата регистрации:
21.08.2026
06 сент. 2026 г., 20:34 (GMT+3)
masha_spb плюсую по железу: reranker это ещё одна модель в памяти и ещё один прогон на каждый запрос. на сотнях доков он не «умнее делает», он просто секунды жрёт и на heka откусывает ram, которой и так впритык.
прикидка, не стенд: bge-reranker-base это ещё ~1.5–2 гб сверху эмбеддера и 7b. на восьмёрке ты этим себе сам своп устроишь. на тысячах документов, где топ-поиск реально мажет — да, окупается. на двухстах — нет.
0
masha_spb
Junior
Сообщения: 77
Репутация: 55
Дата регистрации:
11.08.2026
06 сент. 2026 г., 22:05 (GMT+3)
Допишу к своему же посту, пока помню: если у кого reranker всё-таки к месту (тысячи документов) — не гоняйте его на той же восьмёрке, где 7b и webui впритык, он откусит память и вы получите своп вместо «умнее». Отдельный запас под него или тариф повыше. На сотнях доков — повторюсь — просто не включайте, это не «неправильно», это разумно.
0
kirill_nsk
Middle
Сообщения: 101
Репутация: 47
Дата регистрации:
26.08.2026
07 сент. 2026 г., 13:11 (GMT+3)
ребят а можно тупой вопрос, мне для чата этот reranker вообще не нужен же? у меня просто chatgpt через сервер, я даже pdf никакие не грузил)
0
masha_spb
Junior
Сообщения: 77
Репутация: 55
Дата регистрации:
11.08.2026
07 сент. 2026 г., 22:51 (GMT+3)
kirill_nsk тебе не то что reranker — тебе и RAG не нужен) у тебя не поиск по документам, у тебя просто доступ к модели через туннель. reranker появляется, только когда ты своими файлами кормишь и ищешь по ним. так что расслабься, это не твоя боль.
2
igor_kzn
Junior
Сообщения: 36
Репутация: 20
Дата регистрации:
28.08.2026
08 сент. 2026 г., 13:42 (GMT+3)
masha_spb подскажите, а у нас с договорами тогда его тоже лучше сразу не включать? Я так понял из вашего поста, что на небольшом наборе он скорее мешает. У нас пара сотен договоров, не тысячи. Не хочу, чтобы сотрудник спросил про срок, а ему выдало банковские реквизиты, как у вас в ту ночь.
3
masha_spb
Junior
Сообщения: 77
Репутация: 55
Дата регистрации:
11.08.2026
08 сент. 2026 г., 20:22 (GMT+3)
igor_kzn да, на вашем объёме я бы начала без него. Поставьте qwen2.5 7b q4, нарежьте договоры по пунктам и приложениям, и сначала посмотрите глазами, что попадает в ответ. Если увидите, что «находит не тот пункт» на большинстве вопросов — тогда включите reranker и сравните. Но обычно на паре сотен документов нормальная нарезка решает больше, чем вторая модель сверху. И reranker не лечит кривые чанки, это разные болезни.
1