Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
8 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Recurrent reasoning models have attracted growing attention for scaling test-time computation, typically by iteratively refining latent states with shared parameters. However, these models apply each learned update with a fixed unit scale, which can be conservative when updates make persistent progress and overly aggressive when they fluctuate, limiting the benefit of additional loops. To understand how the scale should vary along the trajectory, we first analyze the sensitivity of terminal loss to recurrent update scale. We show that its temporal average admits an exact decomposition into persistent-progress and centered-fluctuation contributions. Based on this, we introduce the Trajectory Adaptive Progress-Fluctuation Scheduler (TAPS), which tracks their balance across recurrent updates and adapts the step size online. Theoretically, we establish sufficient conditions under which TAPS reduces expected terminal loss and reaches a target quality in fewer recurrent loops. Empirically, we show that TAPS improves terminal accuracy across structured reasoning tasks without retraining. By further incorporating the progress-fluctuation principle into training, TAPS yields additional accuracy gains with up to 1.56 times wall-clock speedup at matched baseline accuracy. The broad applicability of TAPS is supported by its effectiveness across diverse recurrent architectures and inference strategies. Together, these results establish update scale as complementary control axis of recurrent inference alongside architecture and depth.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
8 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
3 дня назадDaily PapersВ статье исследуется линейность в больших языковых моделях (LLM), демонстрируя, что объединение входов из разных потоков текста приводит к суперпозиции распределений следующих токенов. Авторы предполагают, что эта линейность является врожденным свойством архитектуры Transformer и может быть восстановлена с помощью тонкой настройки, позволяя генерировать два согласованных продолжения за один проход.
6 дней назадDaily PapersВ этой статье представлена FuseReg, метод, который заменяет эвристическую фьюзинг-фьюзинг в представительных автокодерах (RAE) обучением на случайных подмножествах слоев кодировщика. Подход уменьшает разрыв между реконструкцией и генерацией, повышая устойчивость к выбору фьюзинга слоев, достигая более высокого PSNR и более низких значений FID генерации без изменения предобученного кодировщика.
5 дней назадDaily PapersВ статье представлена система Omni-IO Skills, которая позволяет существующим агентам обрабатывать различные модальности с помощью иерархических навыков, стандартизированных интерфейсов выполнения и согласованной организации. Показаны значительные улучшения в поддержке входных данных и семантических качественных оценках при применении к GPT-5.6 Sol и Claude Sonnet 5 на наборе данных UniM-90.
5 дней назадDaily PapersВ статье представлена GAGAR — фреймворк для распределения кредитов с учетом качества в RL-агентах для кода. Используется динамическая выборка и SFT-обученный агентный оценщик для ранжирования траекторий, проходящих тесты, и корректировки преимуществ для приоритизации более качественных реализаций. Метод был протестирован на промышленных кодовых агентах с большими количествами параметров.
4 дня назадDaily PapersВ этой статье представлена SentZero, фреймворк предобучения мультимодальных данных, ориентированный на предложения, предназначенный для нулевого обучения многозадачного анализа рентгеновских снимков грудной клетки. Она повышает разнообразие положительных пар и снижает ложные отрицательные результаты за счет структурирования предложений с использованием крупных языковых моделей и модуляции визуальных вложений.
позавчера