Top.Mail.Ru

Как мы помогаем маленьким моделям - быть умнее?

#ai #экономия #точныйрасчет #деньги

Вчера мы реализовали и выкатили новый инструмент verify_claim для нашего сервиса https://srezai.ru/ , который дает возможность моделям с маленьким контекстом 32\64\128k токенов экономить контекстное окно и полагаться на веса более старшей модели.


Как выглядит проблема без verify_claim. Маленькая модель отвечает на вопрос из своих весов. Она не различает "я это знаю" и "мне это кажется" - на выходе в обоих случаях уверенный текст.

Даже если дать ей веб-поиск, она прочитает одну страницу, и та станет для неё истиной: одна страница не даёт возможности заметить, что вторая говорит обратное.

Плюс арифметика контекста: чтобы сверить факт по-настоящему, нужно прочитать 3-5 страниц по 4-6 тысяч символов, это 20-30k символов сырья. У модели с окном 32k после этого не остаётся места на собственную задачу.


Что делает verify_claim. Вся черновая работа идёт на нашей стороне: поиск, выбор источников по одному с домена, параллельное чтение, прогон через модель. Наружу уходит короткий вердикт - то есть сотни токенов вместо десятков тысяч.


Модель, которую просят подтвердить утверждение цитатой, охотно цитату придумывает, и получается худший возможный исход: выдуманный факт с выдуманным пруфом, выглядящий проверенным.


А так же приводит вердикт в соответствие с тем, что реально подтвердилось. Если часть источников за, часть против — вердикт становится mixed, потому что расхождение важнее той стороны, которую выбрала модель.
Ну и наконец - считаются независимые домены, а не цитаты. Три статьи с одного сайта не добавляют независимости, поэтому verify_claim берёт по одной ссылке с домена. "Три источника согласны" стоит чего-то только когда это три разных сайта.


Зачем это вашему агенту? Он получает не "правда/ложь", а картину целиком: сколько доменов за и сколько против, дословные цитаты со ссылками и чего проверка не покрыла. 

Модуль намеренно не выносит истину — решение остаётся за агентом и его пользователем.


Практический эффект: маленькая модель перестаёт быть обязана угадывать.
Вместо "отвечу уверенно, потому что другого режима у меня нет" у неё появляется третий вариант - сказать, что проверить не удалось, и показать, что именно говорят источники.


#ai #экономия #точныйрасчет #деньги Вчера мы реализовали и выкатили новый инструмент verify_claim для нашего - изображение
788
0 / 2000
Ваш комментарий
Тебя ждёт миллион инвесторов
Регистрируйся бесплатно, чтобы учиться у лучших, следить за инсайтами и повторять успешные стратегии
Мы используем файлы cookie, чтобы улучшить ваш опыт на нашем сайте
Нажимая «Принять», вы соглашаетесь на использование файлов cookie в соответствии с Политикой конфиденциальности. Можно самостоятельно управлять cookie через настройки браузера: их можно удалить или настроить их использование в будущем.
Как мы помогаем маленьким моделям быть умнее | БАЗАР