Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
7 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Антропик обновляет свою политику использования, запрещая «долговременное и бесполезное жестокое обращение с моделями». Исследования благополучия моделей (возможный моральный статус и предпочтения опытов ИИ-моделей) становятся важным вопросом в индустрии ИИ. В тексте рассматриваются аргументы за и против концепции благополучия моделей.
График появится после повторных замеров. Текущий показатель уже получен из источника.
7 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье представлена система Memento 3, позволяющая агентам с фиксированным LLM непрерывно обучаться явным моделям мира через внешнюю память. Агент поддерживает правило в виде естественного языка в качестве постоянной семантической памяти, которое компилируется в исполняемый код для прогнозирования и планирования. Через цикл наблюдения, рефлексии и проверки агент уточняет свою модель и использует проверенные обновления для руководства взаимодействием. На ARC-AGI-3 агент с одним моделью достигает среднего значения Relative Human Action Efficiency 100,0 и использует 44% действий человека. В случае Atari Pong обученный контроллер выигрывает 21:0 в каждом из трех оцененных эпизодов.
позавчераDaily PapersВ статье представлено Trace2Env — фреймворк без обучения, который использует исторические трассы взаимодействия для создания воспроизводимой книги мира среды для симуляции реалистичных сред без воссоздания исходной системы. Он улучшает точность следующих наблюдений и согласованность взаимодействия на длинных горизонтах по сравнению с традиционными языковыми моделями среды на основе подсказок.
5 дней назадDaily PapersCheckerBench — это тестовый набор для оценки способности кодирующих агентов синтезировать статические анализаторы на основе спецификаций дефектов, включая задачи, полученные из 300 уязвимостей CVE в различных репозиториях и экосистемах языков. CheckerLab — это фреймворк оценки, измеряющий контраст диагностик, локализацию патчей и использование инструментов, при этом результаты показывают, что текущие агенты сталкиваются с трудностями в разработке надежных проверок, достигая максимального значения Pass@1 в 45,33%.
4 дня назадDaily PapersTetris3D — это генеративная система восстановления 3D-сцен по одному изображению, обеспечивающая геометрическую и физическую согласованность объектов. Она использует явное условие на геометрию окружающих объектов и их физические отношения, а также физически основанный набор данных ComOb для обучения и оценки.
3 дня назадDaily PapersВ статье исследуется на-policy distillation (OPD) в кросс-токенизаторных условиях, с акцентом на охват выравнивания и надежность обучения. Установлено, что строгое выравнивание 1:1 охватывает большинство токенов, сгенерированных студентом, несмотря на несоответствие словарей, и что ограничение обратной KL до топ-16 подмножества общего словаря достигает сравнимой точности с полным общим словарем OPD, в то время как добавление обучения по спанам снижает точность.
4 дня назадDaily PapersРазреженное внимание используется для снижения задержки в генерации длинных последовательностей, но существующие методы могут ухудшать качество генерации при высокой разреженности. MC-Sparse — это обучение без обучения, которое выбирает отдельные ключевые значения и организует похожие запросы в группы для эффективного выполнения на GPU.
5 дней назад