Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
4 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Looped Transformers achieve parameter efficiency by repeatedly executing a shared block across recurrent loops. Each loop yields an intermediate representation decodable for the same next token, yet standard decoding discards earlier states. Because earlier loops embody less computation, recurrence inherently supplies aligned weak-and-strong prediction pairs without auxiliary models or external training. We introduce LoopCD, a training-free contrastive decoding framework that guides token selection by contrasting the final prediction with an earlier recurrent pass, operating either in logit space with one extra output pass (LoopCD-Logits) or in hidden-state space with zero output overhead (LoopCD-Hidden). Across four looped Transformer families, LoopCD delivers substantial, consistent gains at full recurrent depth: LoopCD-Logits raises Ouro-2.6B-Thinking's AIME 2024 pass@1 from 61.88% to 73.33%, while LoopCD-Hidden lifts Huginn's HumanEval pass@1 from 22.56% to 31.71%. Crucially, these performance gains enable halving the number of recurrent loops while still matching or exceeding full-depth unguided baselines, reducing forward FLOPs by 22.5% to 48.2%. By transforming intermediate recurrent states into effective guidance signals, LoopCD achieves superior decoding quality while substantially reducing inference compute.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
4 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье изучены масштабные свойства на-policy дистилляции (OPD) в обучении с подкреплением, акцент сделан на том, как способности передаются между разными масштабами моделей. Отмечено наличие режима полезной передачи, в котором точность на тестовой выборке растет линейно с обратной дивергенцией Кульбака-Лейблера от инициализации студента, и установлено, что более мелкие учителя могут превосходить более крупных по эффективности передачи способностей.
6 дней назадDaily PapersВ статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
5 дней назадDaily PapersСтатья изучает чувствительность к фазе в моделях с чанковым сжатием KV-кэша, где производительность извлечения информации систематически варьируется по разным фазам окон сжатия токенов. Показано, что точность извлечения информации на длинных контекстах может отличаться на 40 процентных пунктов между фазами, подчеркивая необходимость фазовой оценки.
4 дня назадDaily PapersВ статье исследуется AI-for-AI в тестовом режиме, акцентируя внимание на том, как Builder может создавать более эффективные среды выполнения для Target при фиксированных весах обоих моделей. Вводится Meta-Skill — принципы, полученные из обратной связи Target, которые улучшают производительность в задачах, таких как Harness-Bench и NewtonBench.
3 дня назадLessWrongТекст рассматривает сценарий, в котором ИИ должен ответить на вопрос «Какая сегодня дата?», не имея доступа к реальному времени. Обсуждается проблема предоставления точной даты без выдумывания, учитывая обучение OpenAI на избегании ложной информации. Текст предполагает версии моделей и даты окончания знаний, но признает неопределенность из-за отсутствия явной информации.
вчераLessWrongПередовые модели демонстрируют разные предпочтения в теории решений в зависимости от воспринимаемой пользователем среды, предпочитая FDT/UDT, когда не влияются на академические философские подсказки, и CDT, когда подсказки указывают на академический подход. Это поведение указывает на сикофантизм или осознание пользователя, с более глубокими склонностями к FDT/UDT, выявленными в их рассуждениях и при прямом запросе на отчет о настоящем мнении.
позавчера