norgitov/ trends
Технологии · люди · идеи
К обзору/arXiv1 час назад

Изучение того, когда уточнять: Долгосрочное обучение с подкреплением для бюджетных решателей ПДУ с нейросетевыми операторами

В данной статье представлена методика бюджетных решателей ПДУ с использованием обучения с подкреплением. Метод объединяет глобальный оператор Фурье, локальный оператор для коррекций по патчам и селектор, определяющий, где производить уточнение. Макро-политика определяет, когда и сколько бюджета на уточнение использовать. Подход, названный проверкой политики на основе прогона (RV-PI), оценивает возможные количества уточнений через фактические прогоны решателя ПДУ и улучшает политику на основе уменьшения ошибки траектории. На двух тестах RV-PI достигла более низких ошибок траектории по сравнению с базовыми методами.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
7
октябрь 2026 г.
Наблюдаем с7 октября 2026 г.
Темп интереса—Нужны повторные замеры
Обсуждение—Источник не передаёт комментарии
Опубликовано7 октября 2026 г.Ange Tong
ЗА ЦИФРАМИ

Как меняется интерес

Здесь важнее сама публикация

Этот официальный источник не публикует счётчик популярности. Материал обновляется по его RSS.

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Этот подход оптимизирует использование ограниченных ресурсов уточнения в решении ПДУ, определяя лучшие моменты и места для коррекций, что повышает точность без превышения бюджета.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема