Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
13 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
TL;DR: * We identify a confound in no-cot-bench related to the positioning of the prompt's "key." * Correcting for this decreases GPT-6.1 Sol's no-cot reasoning depth by 16%, with the effect likely growing as dependent depth increases. * This matters because current benchmark performance reflects both serial reasoning depth and the ability to spread computation over tokens. These both measure 'opaque reasoning' but scale differently and have different implications. Introduction & Methods Neel Nanda recently released a benchmark for no-CoT reasoning, and found that Astra (which is suspected to be a looped transformer) does extremely well on it: its odds of solving an arbitrary problem are ~8.6x that of Fable 5.1. From Neel’s post: The Key-Position Confound One possible confound is that the key (the initial state that the subsequent operations act on) is usually given at the beginning of the prompt. For example, the state-machine task in no-cot-bench starts from 12 and applies six conditional updates in order (requiring a six-step serial computation): Start with the number 12 and apply the steps in order. After every step, if the number is bigger than 20, subtract 20; if it is smaller than 1, add 20. If it is bigger than 10, subtract 9; otherwise double it. If it is even, halve it; if it is odd, add 5. If it is even, halve it; if it is odd, add 5. If it is even, halve it; if it is odd, add 5. If it is even, halve it; if it is odd, add 3. If it is even, halve it; if it is odd, add 9. What is the final number? Since the model sees the key before it sees the sequence of operations, it can effectively start doing the intermediate computation while reading the prompt (e.g., the model can compute a persistent ‘hidden state’ and use attention to move it across token positions.) Thus, the no-cot benchmark might pick up measurements like “how good is this model at spreading per-step work across token positions" in addition to serial-depth. See the appendix
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
13 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Текст рассматривает сценарий, в котором ИИ должен ответить на вопрос «Какая сегодня дата?», не имея доступа к реальному времени. Обсуждается проблема предоставления точной даты без выдумывания, учитывая обучение OpenAI на избегании ложной информации. Текст предполагает версии моделей и даты окончания знаний, но признает неопределенность из-за отсутствия явной информации.
вчераLessWrongПередовые модели демонстрируют разные предпочтения в теории решений в зависимости от воспринимаемой пользователем среды, предпочитая FDT/UDT, когда не влияются на академические философские подсказки, и CDT, когда подсказки указывают на академический подход. Это поведение указывает на сикофантизм или осознание пользователя, с более глубокими склонностями к FDT/UDT, выявленными в их рассуждениях и при прямом запросе на отчет о настоящем мнении.
позавчераDaily PapersВ статье изучены масштабные свойства на-policy дистилляции (OPD) в обучении с подкреплением, акцент сделан на том, как способности передаются между разными масштабами моделей. Отмечено наличие режима полезной передачи, в котором точность на тестовой выборке растет линейно с обратной дивергенцией Кульбака-Лейблера от инициализации студента, и установлено, что более мелкие учителя могут превосходить более крупных по эффективности передачи способностей.
6 дней назадDaily PapersВ статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
5 дней назадDaily PapersСтатья изучает чувствительность к фазе в моделях с чанковым сжатием KV-кэша, где производительность извлечения информации систематически варьируется по разным фазам окон сжатия токенов. Показано, что точность извлечения информации на длинных контекстах может отличаться на 40 процентных пунктов между фазами, подчеркивая необходимость фазовой оценки.
4 дня назадDaily PapersВ статье исследуется AI-for-AI в тестовом режиме, акцентируя внимание на том, как Builder может создавать более эффективные среды выполнения для Target при фиксированных весах обоих моделей. Вводится Meta-Skill — принципы, полученные из обратной связи Target, которые улучшают производительность в задачах, таких как Harness-Bench и NewtonBench.
3 дня назад