Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
175 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
*Reinforcement learning (RL)* can induce substantial reasoning capabilities in large language models (LLMs), but how much of this capability transfers across model scales, and how quickly, remains unclear. We study the scaling properties of *on-policy distillation (OPD)* across *weak-to-strong*, *same-base*, and *strong-to-weak* teacher--student setups. We find that early OPD training dynamics uniformly exhibit a regular *useful-transfer* regime, in which held-out accuracy (the *gold score*, G) rises approximately linearly in d=mathrm{KL(π_θVert π_{ref})}, the square root of token-level reverse KL divergence from the student initialization. In every observed weak-to-strong pair, the student's peak gold score exceeds its teacher's own, so a compact RL expert can transfer capability to a much larger student via OPD. To estimate OPD outcomes, we fit *power laws* for how G_{peak} and the slope of the useful-transfer regime scale with student and teacher parameter counts and with teacher gold score. These laws show that peak gold score improves with teacher scale only up to roughly the student's scale, and that at a matched gold score smaller teachers transfer better, so a teacher's score alone does not define its supervision value. We also study the scaling effects of two OPD variants, bootstrapping weak-to-strong OPD, and the degree of on-policy supervision.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
175 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
4 дня назадDaily PapersChunked KV-cache compression reduces the memory and attention costs of long-context inference by compressing windows of consecutive tokens into fewer cache entries at a fixed stride. Such compression also introduces a new positional coordinate: a token's phase, or its position relative to compression-window boundaries. We uncover a systematic asymmetry in models using such compression: the same information can be easy to retrieve at one phase and difficult at another. We call this periodic variation in retrieval performance phase sensitivity. In large open-weight models with such compression, long-context retrieval accuracy can differ by up to 40 percentage points across phases, revealing periodic weak spots that average benchmark scores can conceal. To investigate this behavior, we pretrain a family of transformers from scratch across multiple KV-compression designs, reproducing phase sensitivity across the variants. Mechanistic analysis using causal interventions in these models reveals phase specialization: different attention components contribute asymmetrically to retrieving information at different source phases. We further analyze idealized retrieval models, showing how gradient flow dynamics may favor sharp phase specialization. Evaluating models with chunked KV-cache compression thus requires measuring across compression phases: high average accuracy can coexist with systematic positional failures.
3 дня назадDaily PapersВ этой статье представлена FuseReg, метод, который заменяет эвристическую фьюзинг-фьюзинг в представительных автокодерах (RAE) обучением на случайных подмножествах слоев кодировщика. Подход уменьшает разрыв между реконструкцией и генерацией, повышая устойчивость к выбору фьюзинга слоев, достигая более высокого PSNR и более низких значений FID генерации без изменения предобученного кодировщика.
6 дней назадDaily PapersВ статье представлена система Omni-IO Skills, которая позволяет существующим агентам обрабатывать различные модальности с помощью иерархических навыков, стандартизированных интерфейсов выполнения и согласованной организации. Показаны значительные улучшения в поддержке входных данных и семантических качественных оценках при применении к GPT-5.6 Sol и Claude Sonnet 5 на наборе данных UniM-90.
6 дней назадDaily PapersВ статье представлена GAGAR — фреймворк для распределения кредитов с учетом качества в RL-агентах для кода. Используется динамическая выборка и SFT-обученный агентный оценщик для ранжирования траекторий, проходящих тесты, и корректировки преимуществ для приоритизации более качественных реализаций. Метод был протестирован на промышленных кодовых агентах с большими количествами параметров.
5 дней назадLessWrongПередовые модели демонстрируют разные предпочтения в теории решений в зависимости от воспринимаемой пользователем среды, предпочитая FDT/UDT, когда не влияются на академические философские подсказки, и CDT, когда подсказки указывают на академический подход. Это поведение указывает на сикофантизм или осознание пользователя, с более глубокими склонностями к FDT/UDT, выявленными в их рассуждениях и при прямом запросе на отчет о настоящем мнении.
8 часов назад