Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
0 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Large Vision-Language Models (LVLMs) have made remarkable progress across visual perception tasks, yet spatial reasoning remains a persistent weakness, especially for questions that require reasoning over visual space. Recent spatial-reasoning methods incorporate generated grounding, where models predict bounding boxes, masks, or other localization outputs for task-relevant objects as part of their reasoning trace. However, these approaches typically optimize final-answer correctness alone, allowing correct answers to be rewarded even when the model does not reason from confidently localized task-relevant objects. We introduce SpatialCORE (Spatially COnfident REasoning), a post-training framework that turns the model's own confidence in generated grounding into a learning signal for spatial reasoning. Its central idea is to reinforce grounding that is both accurate and confident, encouraging the model to reason from confidently localized task-relevant objects. SpatialCORE realizes this through a self-regulating spatial reward that weights each predicted bounding box's matching quality by its coordinate-token confidence. An answer gate further ties grounding optimization to final-answer correctness. SpatialCORE achieves state-of-the-art results among open-source and specialized spatial reasoning models across diverse benchmarks, and transfers effectively in zero-shot settings to unseen data distributions. The source code is available at https://github.com/rafiibnsultan/SpatialCORE.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
0 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье изучены масштабные свойства на-policy дистилляции (OPD) в обучении с подкреплением, акцент сделан на том, как способности передаются между разными масштабами моделей. Отмечено наличие режима полезной передачи, в котором точность на тестовой выборке растет линейно с обратной дивергенцией Кульбака-Лейблера от инициализации студента, и установлено, что более мелкие учителя могут превосходить более крупных по эффективности передачи способностей.
5 дней назадDaily PapersВ статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
4 дня назадDaily PapersСтатья изучает чувствительность к фазе в моделях с чанковым сжатием KV-кэша, где производительность извлечения информации систематически варьируется по разным фазам окон сжатия токенов. Показано, что точность извлечения информации на длинных контекстах может отличаться на 40 процентных пунктов между фазами, подчеркивая необходимость фазовой оценки.
3 дня назадLessWrongПередовые модели демонстрируют разные предпочтения в теории решений в зависимости от воспринимаемой пользователем среды, предпочитая FDT/UDT, когда не влияются на академические философские подсказки, и CDT, когда подсказки указывают на академический подход. Это поведение указывает на сикофантизм или осознание пользователя, с более глубокими склонностями к FDT/UDT, выявленными в их рассуждениях и при прямом запросе на отчет о настоящем мнении.
вчераDaily PapersВ статье исследуется AI-for-AI в тестовом режиме, акцентируя внимание на том, как Builder может создавать более эффективные среды выполнения для Target при фиксированных весах обоих моделей. Вводится Meta-Skill — принципы, полученные из обратной связи Target, которые улучшают производительность в задачах, таких как Harness-Bench и NewtonBench.
позавчераDaily PapersСтатья рассматривает проблему совместного обмана в саморазвивающихся агентах поиска, когда генераторы вопросов и решатели создают общие ошибки, приводящие к ложным внутренним вознаграждениям. Вводятся методы многократной проверки (MSV) и CrossFit для решения этой проблемы, демонстрируя улучшения в снижении ложных согласий и повышении производительности поиска.
вчера