Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
6 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
We introduce LIFT, a unified image-to-video generation framework that complements camera control with Layout-In-FuTure control, enabling users to specify what should appear in a future view and where it should appear. This addresses a practical need in controllable video generation: given an initial image, users often care not only about how the camera moves, but also about what the scene should look like at key future moments, especially the final frame. Existing camera controls specify viewpoint trajectories, while text prompts provide only coarse semantic guidance; neither precisely determines the content and spatial layout of future views. This limitation becomes particularly pronounced under large viewpoint changes, where the camera reveals regions that are not visible in the first frame. LIFT therefore uses the last-frame layout as an explicit control signal for the desired future scene. Since learning from such sparse layout guidance is substantially more challenging than conditioning on dense per-frame layouts, we introduce on-policy self-distillation (OPSD) to transfer the control capability of a dense-layout teacher to a last-frame-layout student. We further curate LIFT-Vista, a dataset featuring large viewpoint changes with camera and temporally consistent layout annotations. Experiments show that LIFT improves video quality, future-layout controllability, and camera controllability over other methods.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
6 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
3 дня назадDaily PapersВ этой статье представлена FuseReg, метод, который заменяет эвристическую фьюзинг-фьюзинг в представительных автокодерах (RAE) обучением на случайных подмножествах слоев кодировщика. Подход уменьшает разрыв между реконструкцией и генерацией, повышая устойчивость к выбору фьюзинга слоев, достигая более высокого PSNR и более низких значений FID генерации без изменения предобученного кодировщика.
5 дней назадDaily PapersВ статье исследуется линейность в больших языковых моделях (LLM), демонстрируя, что объединение входов из разных потоков текста приводит к суперпозиции распределений следующих токенов. Авторы предполагают, что эта линейность является врожденным свойством архитектуры Transformer и может быть восстановлена с помощью тонкой настройки, позволяя генерировать два согласованных продолжения за один проход.
6 дней назадDaily PapersВ статье представлена система Omni-IO Skills, которая позволяет существующим агентам обрабатывать различные модальности с помощью иерархических навыков, стандартизированных интерфейсов выполнения и согласованной организации. Показаны значительные улучшения в поддержке входных данных и семантических качественных оценках при применении к GPT-5.6 Sol и Claude Sonnet 5 на наборе данных UniM-90.
5 дней назадDaily PapersВ статье представлена GAGAR — фреймворк для распределения кредитов с учетом качества в RL-агентах для кода. Используется динамическая выборка и SFT-обученный агентный оценщик для ранжирования траекторий, проходящих тесты, и корректировки преимуществ для приоритизации более качественных реализаций. Метод был протестирован на промышленных кодовых агентах с большими количествами параметров.
4 дня назадDaily PapersВ этой статье представлена SentZero, фреймворк предобучения мультимодальных данных, ориентированный на предложения, предназначенный для нулевого обучения многозадачного анализа рентгеновских снимков грудной клетки. Она повышает разнообразие положительных пар и снижает ложные отрицательные результаты за счет структурирования предложений с использованием крупных языковых моделей и модуляции визуальных вложений.
позавчера