HardFlow: ИИ, знающий свои пределы
Генеративные модели ИИ отлично справляются с формированием ответов, которые являются “почти” правильными. Но в ситуациях с высокими рисками, например, в промышленной системе управления или когда робот движется по переполненному заводскому цеху, результата “почти” правильно недостаточно. Даже незначительное отклонение в маршруте робота может привести к столкновению – риск, который ярко продемонстрировали всего несколько недель назад на Всемирных играх гуманоидных роботов 2026 года в Китае, когда андроиды не могли безопасно затормозить и врезались в барьеры.
Исследователи из MIT представили новый алгоритм под названием “HardFlow”, который непосредственно решает эту проблему. Он дает генеративным моделям больше свободы для поиска возможных решений в процессе генерации, при этом требуя, чтобы конечный результат соответствовал строгим, обязательным требованиям безопасности, законам физики или конкретным условиям задачи.
Диффузионные модели, такие как Stable Diffusion, и модели на основе flow matching, такие как FLUX, стали мощными инструментами для решения все более сложных задач. Однако хотя такие модели способны создавать результаты, близкие к желаемым, почти правильный ответ может оказаться неприемлемым, если нарушение определенного ограничения способно привести к серьезным последствиям.
Стандартным подходом к решению этой проблемы является выборка на основе проекции, которая на протяжении всего процесса генерации неоднократно заставляет частичные промежуточные результаты модели соответствовать ограничениям. Проблема заключается в том, что запреты на каждом шаге могут помешать модели достичь лучшего конечного результата. Кроме того, такие методы часто сосредоточены преимущественно на соблюдении ограничений, оставляя меньше возможностей для оптимизации других характеристик результата, например, эффективности траектории робота или качества отредактированного изображения.
HardFlow использует иной подход. Поскольку промежуточные результаты отбрасываются после завершения генерации, исследователи пришли к выводу, что в конечном счете именно итоговый результат должен соответствовать жестким лимитам. Предоставляя модели больше свободы на ранних этапах, алгоритм позволяет ей исследовать более широкий спектр возможностей, прежде чем прийти к допустимому решению.
HardFlow переосмысливает генерацию с ограничениями, используя идеи теории оптимального управления и рассматривая этот процесс как задачу оптимизации траектории. Вместо того чтобы постоянно заставлять промежуточные результаты соответствовать требованиям, алгоритм вносит целенаправленные коррективы в траекторию выборки модели, постепенно направляя ее к решению, соответствующему необходимым ограничениям.
Решение такой оптимизационной задачи вокруг большой нейронной сети представляет собой сложную задачу. Исследователи решили ее, используя внутреннюю структуру flow-matching моделей и разделив общую задачу на последовательность небольших одноэтапных подзадач оптимизации. Это позволило разработать алгоритм, способный работать во время развертывания без переобучения базовой генеративной модели.
Оптимизационный подход также позволяет HardFlow одновременно работать с дополнительными целями помимо соблюдения ограничений. Например, робот может не только избегать препятствий, но и искать наиболее эффективный маршрут к цели. Таким образом, система может выбирать оптимальный вариант среди всех решений, соответствующих требованиям безопасности, вместо того чтобы просто находить первый допустимый маршрут.
Исследователи протестировали HardFlow на задачах, связанных с роботизированными манипуляциями, навигацией в лабиринтах и редактированием изображений по текстовым инструкциям. По данным MIT, во всех экспериментах метод обеспечил полное соблюдение заданных ограничений и в то же время продемонстрировал более высокое качество решений по сравнению с базовыми методами. Например, во время тестов с роботизированным манипулятором HardFlow позволил избегать столкновений с препятствиями и одновременно находить самый быстрый маршрут к целевому объекту. В экспериментах по редактированию изображений алгоритм мог выполнять необходимые изменения, лучше сохраняя нетронутыми остальные части изображения. Его вычислительные затраты также были сопоставимы с показателями большинства конкурирующих методов или ниже их.
Одним из практических преимуществ метода является то, что он работает при использовании уже обученных моделей, то есть базовую модель ИИ не нужно заново обучать каждый раз, когда HardFlow применяется к задаче генерации с ограничениями. Это может упростить адаптацию генеративных моделей к сферам, где требования безопасности и физические ограничения нельзя нарушать.
Потенциальные области применения выходят далеко за рамки генерации изображений. Исследователи MIT называют среди них робототехнику, управление физическими системами и компьютерное зрение – сферы, где генерируемые решения должны соответствовать требованиям, которые нельзя рассматривать как необязательные.