Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
33 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Исследование выявило 485 химических веществ в продуктах для борьбы с вредителями в США, связанных с раком молочной железы.
График появится после повторных замеров. Текущий показатель уже получен из источника.
33 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В статье исследуется линейность в больших языковых моделях (LLM), демонстрируя, что объединение входов из разных потоков текста приводит к суперпозиции распределений следующих токенов. Авторы предполагают, что эта линейность является врожденным свойством архитектуры Transformer и может быть восстановлена с помощью тонкой настройки, позволяя генерировать два согласованных продолжения за один проход.
4 дня назадDaily PapersВ статье представлена Taste-Bench — тест для оценки «вкуса» агента при принятии решений на длинных горизонтах. Она измеряет способность выбирать лучший путь на точках ветвления без знания будущих исходов, показывая, что современные модели плохо справляются, и что вкус можно улучшить с помощью дистилляции.
6 дней назадDaily PapersИсследование изучает JEV-as-a-Judge, экономичный метод оценки языковых моделей, основанный на уровнях уверенности, демонстрируя сравнимую производительность с ведущими судьями за долю стоимости. Подчеркивается, что JEV хорошо справляется со стандартными задачами, но испытывает трудности с сложными оценками, требующими глубокого анализа, но каскадная система, передающая сомнительные случаи, сохраняет большую часть точности при более низкой стоимости.
6 дней назадLessWrongЭтот пост исследует замешательство автора относительно того, как нейронные сети, особенно большие языковые модели (LLM), выполняют и учатся вычислениям. Он подвергает сомнению традиционный подход к механической интерпретации, основанный на цепях, утверждая, что «цепи» и «вычисления» могут не быть наиболее подходящей основой для понимания LLM. Эссе обсуждает представительный дрейф как ключевую проблему для анализа цепей на основе весов и предлагает «ко-селекционистскую» точку зрения на цепи как возникающие единицы. Автор также размышляет о том, как концепция «универсальности» должна влиять на объяснения функционирования LLM.
6 дней назадDaily PapersВ данной работе представлено StableVQ, метод повышения стабильности обучения векторно-квантованных токенизаторов, устраняющий взаимосвязь между обучением энкодера-декодера и кодовой книги. Предлагаются три ключевых компонента: Dynamic STE для стабилизации энкодера, Region VQ Loss для обучения кодовой книги и Decoupled Schedule для отдельных динамик оптимизации. Эксперименты на ImageNet показывают улучшение стабильности обучения, использования кодовой книги и качества восстановления.
6 дней назадDaily PapersВ данной статье рассматриваются механизмы памяти в авторегрессивном (AR) генерировании видео, акцентируя внимание на том, как историческая информация влияет на будущие генерации, несмотря на ограниченные окна контекста. Статья организует литературу через пять аспектов: формы, функции, операции, обучение и оценку, подчеркивая вызовы, такие как архитектуры памяти с учетом ресурсов и стандартизированные оценки.
5 дней назад