Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
79 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
ArXiv получил многолетние обязательства по поддержке его деятельности в качестве независимой некоммерческой организации.
График появится после повторных замеров. Текущий показатель уже получен из источника.
79 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
IntBMoE представляет блок-условную архитектуру Mixture-of-Experts (MoE), которая разделяет участие, выполнение и материализацию, объединяя плотную композицию экспертов с разреженным выполнением блоков. Используется обученная кодовая книга для блоков и гиперсеть для объединения экспертов, обеспечивая полное участие при низких затратах на выполнение и память. Эксперименты показывают улучшения в классификации изображений, языковом моделировании и последовательном рекомендовании, с реальным внедрением в системе рекомендаций AMap.
6 дней назадDaily PapersВ статье представлена Taste-Bench — тест для оценки «вкуса» агента при принятии решений на длинных горизонтах. Она измеряет способность выбирать лучший путь на точках ветвления без знания будущих исходов, показывая, что современные модели плохо справляются, и что вкус можно улучшить с помощью дистилляции.
позавчераDaily PapersВ статье представлена методика Document Retrieval-Aware Chunking (D-RAC), которая эффективно обрабатывает корпоративные документы, нормализуя их в PDF и преобразуя в оптимизированный для поиска Markdown с использованием мультимодельной ИИ. Этот подход сохраняет структуру документа, снижает затраты на токены и повышает эффективность фрагментации.
3 дня назадDaily PapersВ этой статье представлена система распознавания текста в сцене, охватывающая несколько языков, использующая архитектуру Mixture-of-Experts (MoE), учитывающую письменность. Система ScriptMoE превосходит существующие методы на задачах распознавания многоязычного текста, используя большой синтетический датасет и легковесную архитектуру, которая делит визуальный кодировщик, а декодирование выполняется специализированными экспертами для каждой письменности.
3 дня назадLessWrongЭтот пост исследует замешательство автора относительно того, как нейронные сети, особенно большие языковые модели (LLM), выполняют и учатся вычислениям. Он подвергает сомнению традиционный подход к механической интерпретации, основанный на цепях, утверждая, что «цепи» и «вычисления» могут не быть наиболее подходящей основой для понимания LLM. Эссе обсуждает представительный дрейф как ключевую проблему для анализа цепей на основе весов и предлагает «ко-селекционистскую» точку зрения на цепи как возникающие единицы. Автор также размышляет о том, как концепция «универсальности» должна влиять на объяснения функционирования LLM.
позавчераDaily PapersCodeMidas — агентный пайплайн, преобразующий реализованную функциональность в открытых кодовых базах в исполняемые среды для обучения с подкреплением (RL), используя только исходный код в качестве входных данных. Он генерирует 5 545 тренировочных задач из 3 185 кодовых баз, охватывающих 23 языка и 15 технических областей, улучшая производительность на нескольких кодовых бенчмарках при обучении MiMo-V2.5 с использованием GRPO.
6 дней назад