norgitov/ trends
Технологии · люди · идеи
К обзору/arXiv2 часа назад

Что учат верифицированные вознаграждения видео-модели языка о времени? Контролируемое много-модельное исследование

В данном исследовании изучается, как обучение с верифицируемыми вознаграждениями (RLVR) влияет на понимание времени видео-моделями. Четыре открытые модели тренировались с различными рецептами данных, включая верифицированные синтетические данные, неверифицированные реальные видео и их смесь. Результаты показывают, что верифицированное обучение улучшает производительность в домене, но может негативно сказываться на производительности вне домена, если не смешивать реальные данные. Несмотря на наличие наград за порядок событий, модели не развили сильного понимания временной последовательности.

Открыть первоисточник
СИГНАЛ ИЗ ИСТОЧНИКА
6
октябрь 2026 г.
Наблюдаем с6 октября 2026 г.
Темп интереса—Нужны повторные замеры
Обсуждение—Источник не передаёт комментарии
Опубликовано6 октября 2026 г.Avyay Sadhu, Patrick Cooper
ЗА ЦИФРАМИ

Как меняется интерес

Здесь важнее сама публикация

Этот официальный источник не публикует счётчик популярности. Материал обновляется по его RSS.

Только реальные замеры. История до подключения источника не восстанавливается.

ЗАЧЕМ ОБРАТИТЬ ВНИМАНИЕ

Это исследование дает понимание того, как верифицированные вознаграждения влияют на понимание времени видео-моделями, подчеркивая важность смешивания реальных данных для предотвращения проблем вне домена.

Полезная находка?
ПРОДОЛЖИ ИССЛЕДОВАНИЕ

Рядом по теме

Вся тема