#ydb — посты и обсуждения
1 доступный пост
Развивая данную тему поинтересовался, а может ли ИИ (#LLM) в том виде, котором мы их используем через чаты и API решать задачу поиска оптимального решения.
Были взяты самые популярные сервисы: #YandexGPT 5.1 (через #API с векторной базой #YDB и без), #DeepSeek 4 Flash (через API Yandex Cloud), #GigaChat 3.5 Ultra (чат), #ChatGPT-5.6 Luna, #Claude Sonnet 5.
Проверка результата через #RStudio.
Для примера была взята классическая задача (поиск весов ИИ), это поиск минимальных остатков. В математике, это метод наименьших квадратов (МНК).
Где применяется? Например, расчет премий по лестнице достижений (% продаж). Или решение задачи подбора параметров в матрицу через функцию минимизации затрат или максимизации выручки. В Excel для этого часто используют функции ВПР или ПОИСКПОЗ+ИНДЕКС.
Немного ранее писал, что решил свою давнюю задачу по запуску обучения разных видов (ИИ) моделей (DNN, LSTM и др) на исторических данных “с учителем”.
Первая
Вторая
https://finbazar.ru/post/818752-kak-menyaetsya-equity-esli-uchitel-ii-dnn-lstm-budet-menee-dergannym
Так вот.
Постановка задачи
Использовать свернутые данные в один числовой вектор (‘x’) по котировками и второй вектор (‘y’) с метками от 1 до 2 (продать или купить) в качестве учителя (‘dt_train / train’).
Второй вектор (‘test’), тестовый, использовать в качестве задачи поиска наиболее подходящего значения из набора train. Найти значение с наименьшим разностным остатком, вывести найденное значение, вывести соответствующее значение из вектора ‘y’, подсчитать процент совпадения ‘p’. Вывести результат в JSON формате и таблице.
Предварительно был загружен тренировочный набор ‘dt_train / train’.
Промпт выглядит так:
x
1,053252588
-0,293614992
-0,194761592
-0,34980501
-0,310607875
-0,051729657
-0,367246745
0,287114539
-0,427839421-0,370099426
Сопоставь со значениями из поискового индекса dt_train / train, найди наиболее подходящие значения из колонки 'y'. Напротив каждой строки, дополнительно выведи колонку 'p' с вероятностью совпадения. Выведи только результат в формате JSON.
На все результаты будет отдельная ссылка (текстовый файл), так как много “воды” в ответах чатов ГПТ, экономлю ваше время. Кто захочет, посмотрит и возможно перепроверит результаты.
Результаты тестирования
№ 1
https://disk.yandex.ru/i/yUXdVozT6mwMlQ
Не удовлетворительно.
№ 2
https://disk.yandex.ru/i/AIiaKTZPHY8LiA
Не удовлетворительно.
№ 3
https://disk.yandex.ru/i/rwg7xTKr5V6Bug
Не удовлетворительно.
№ 4
https://disk.yandex.ru/i/CXm8vnrPAJHtVA
Тест пройден, точность 100%.
№ 5
https://disk.yandex.ru/i/YaAxdFUVs-4y5g
Не удовлетворительно.
№ 6
https://disk.yandex.ru/i/zT1eNJ4yoBg2_g
Тест пройден, точность 100%.
№ 7
https://disk.yandex.ru/i/MUmFz3z0b0uXDw
Тест пройден, точность 100%.
№ 8
https://disk.yandex.ru/i/SFr-NTmgdpl80Q
Не удовлетворительно.
№ 9
https://disk.yandex.ru/i/BfeLsyutneYScg
Не удовлетворительно.
Расшифровка
№ 1 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 2 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 3 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 4 - Claude Sonnet 5 (40 секунд) - тест пройден, точность 100%.
№ 5 - GigaChat 3 Ultra (10 секунд) - не удовлетворительно
№ 6 - RStudio, язык R (0,01 секунда), скрипт - https://disk.yandex.ru/i/RSHBKPumr1jMUw - тест пройден, точность 100%.
№ 7 - ChatGPT-5.6 Luna (10 секунд) - тест пройден, точность 100%.
№ 8 - Excel ВПР, ПОИСКПОЗ+ИНДЕКС (1 секунда + сортировка)
№ 9 - ChatGPT-5.6 Luna (10 секунд) - не удовлетворительно
Полный пакет файлов с результатами и исходниками - https://disk.yandex.ru/d/-kBOHYdMpTyG_w
Выводы
Будьте очень осторожны при постановке задач поиска оптимального математического решения (задача оптимизации по минимальной или максимально функции), когда делегируете это в ИИ модели (чаты или API). Из ИИ доступных сервисов и чатов GPT, задачу поиска подходящего значения через минимальные остатки решил только Claude Sonnet 5 за 40 секунд.
ChatGPT сначала выдал не правильно, потом правильно.
DeepSeek не смог решить задачу, всегда выдавал разные результаты и очень долго это делал.
YandexGPT 5.1 не решил, так как выходных токенов ему не хватило, уперся в свои ограничения. Даже с YDB.
Excel с некоторым приближением достаточно хорошо решает подобные задачи, но не здесь.
В RStudio на языке R эта задача выполняется за 0,01 секунду, с помощью одной строки: nearest_idx <- sapply(x, function(v) which.min(abs(target_x - v))).
В данный момент сервисы с LLM моделями либо не могут решить, либо расходуют слишком много времени (энергии) на ее решение.
Был ли у вас какой либо положительных или отрицательных опыт, поделитесь.