Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
1 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Agents increasingly build on code written by other agents, and they reimplement rather than reuse, growing the codebases later agents must work in. To measure how well agents design libraries for other agents, we introduce LibraryDesignBench, a two-phase benchmark in which an agent implements a full-featured library from a specification that defines required capabilities and potential use cases without prescribing the design. We evaluate the library through the correctness and simplicity of programs written by three user agents from different model families. The benchmark spans 242 expert-validated programming problems across 15 library-design tasks in four languages. On eleven of the fifteen tasks, agent designers reproduce the abstractions of the human-written production library. Downstream agents adopt agent- and human-written libraries alike but underuse them, reimplementing capabilities the library already provides. Our failure analysis finds that downstream agents write extra code mainly because agent-written libraries are rigid or hard to use, not because capabilities are missing. We also experiment with giving designers more prescriptive, agent-first guidance and having them test their library with subagents; this improves downstream scores and yields simpler programs. LibraryDesignBench provides both a testbed for evaluating library-design practices for agent users and an initial design baseline that improves downstream reuse.
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
1 голосов источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье представлена VisionHOPE, новая визуальная основа, функционирующая как система самосовершенствующегося обучения, позволяющая модели совместно развивать то, что она запоминает, и как она учится внутри изображения. Используются пять взаимосвязанных памяти и схема контроля размера шага, соответствующая устойчивости, чтобы обеспечить стабильные динамики обучения, достигая конкурентоспособных результатов на таких наборах данных, как ImageNet-1K, COCO и ADE20K.
3 дня назадDaily PapersВ статье исследуется линейность в больших языковых моделях (LLM), демонстрируя, что объединение входов из разных потоков текста приводит к суперпозиции распределений следующих токенов. Авторы предполагают, что эта линейность является врожденным свойством архитектуры Transformer и может быть восстановлена с помощью тонкой настройки, позволяя генерировать два согласованных продолжения за один проход.
6 дней назадDaily PapersВ этой статье представлена FuseReg, метод, который заменяет эвристическую фьюзинг-фьюзинг в представительных автокодерах (RAE) обучением на случайных подмножествах слоев кодировщика. Подход уменьшает разрыв между реконструкцией и генерацией, повышая устойчивость к выбору фьюзинга слоев, достигая более высокого PSNR и более низких значений FID генерации без изменения предобученного кодировщика.
5 дней назадDaily PapersВ статье представлена система Omni-IO Skills, которая позволяет существующим агентам обрабатывать различные модальности с помощью иерархических навыков, стандартизированных интерфейсов выполнения и согласованной организации. Показаны значительные улучшения в поддержке входных данных и семантических качественных оценках при применении к GPT-5.6 Sol и Claude Sonnet 5 на наборе данных UniM-90.
5 дней назадDaily PapersВ статье представлена GAGAR — фреймворк для распределения кредитов с учетом качества в RL-агентах для кода. Используется динамическая выборка и SFT-обученный агентный оценщик для ранжирования траекторий, проходящих тесты, и корректировки преимуществ для приоритизации более качественных реализаций. Метод был протестирован на промышленных кодовых агентах с большими количествами параметров.
4 дня назадDaily PapersВ этой статье представлена SentZero, фреймворк предобучения мультимодальных данных, ориентированный на предложения, предназначенный для нулевого обучения многозадачного анализа рентгеновских снимков грудной клетки. Она повышает разнообразие положительных пар и снижает ложные отрицательные результаты за счет структурирования предложений с использованием крупных языковых моделей и модуляции визуальных вложений.
позавчера