
DeepSeek выпустила V4.1-Flash и делает ставку на экономику AI-агентов: меньше памяти под KV cache, меньше нагрузки на GPU, SSD и пропускную способность при длинных сценариях. Для команд, которые считают стоимость агентных задач, это может быть важнее очередного громкого места в бенчмарке.
Компания заявляет, что быстрый буфер в GPU-памяти теперь занимает около четверти прежнего объёма, а выгружаемая часть сокращена примерно до одной восьмой. Практический эффект простой: больше длинных агентных запусков на той же инфраструктуре, если качество и стабильность подтвердятся в рабочих задачах.
Разбираем, что именно изменила DeepSeek и где у V4.1-Flash остаются ограничения:
Подробнее: https://ai-digest.ru/go/finbazar/3236/