#ai #экономия #точныйрасчет #деньги
Вчера мы реализовали и выкатили новый инструмент verify_claim для нашего сервиса https://srezai.ru/ , который дает возможность моделям с маленьким контекстом 32\64\128k токенов экономить контекстное окно и полагаться на веса более старшей модели.
Как выглядит проблема без verify_claim. Маленькая модель отвечает на вопрос из своих весов. Она не различает "я это знаю" и "мне это кажется" - на выходе в обоих случаях уверенный текст.
Даже если дать ей веб-поиск, она прочитает одну страницу, и та станет для неё истиной: одна страница не даёт возможности заметить, что вторая говорит обратное.
Плюс арифметика контекста: чтобы сверить факт по-настоящему, нужно прочитать 3-5 страниц по 4-6 тысяч символов, это 20-30k символов сырья. У модели с окном 32k после этого не остаётся места на собственную задачу.
Что делает verify_claim. Вся черновая работа идёт на нашей стороне: поиск, выбор источников по одному с домена, параллельное чтение, прогон через модель. Наружу уходит короткий вердикт - то есть сотни токенов вместо десятков тысяч.
Модель, которую просят подтвердить утверждение цитатой, охотно цитату придумывает, и получается худший возможный исход: выдуманный факт с выдуманным пруфом, выглядящий проверенным.
А так же приводит вердикт в соответствие с тем, что реально подтвердилось. Если часть источников за, часть против — вердикт становится mixed, потому что расхождение важнее той стороны, которую выбрала модель.
Ну и наконец - считаются независимые домены, а не цитаты. Три статьи с одного сайта не добавляют независимости, поэтому verify_claim берёт по одной ссылке с домена. "Три источника согласны" стоит чего-то только когда это три разных сайта.
Зачем это вашему агенту? Он получает не "правда/ложь", а картину целиком: сколько доменов за и сколько против, дословные цитаты со ссылками и чего проверка не покрыла.
Модуль намеренно не выносит истину — решение остаётся за агентом и его пользователем.
Практический эффект: маленькая модель перестаёт быть обязана угадывать.
Вместо "отвечу уверенно, потому что другого режима у меня нет" у неё появляется третий вариант - сказать, что проверить не удалось, и показать, что именно говорят источники.
