Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
8 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Reposted from shortform because I think this is important enough to be a post. A few ways staying in a technology development race still makes things worse, even when there are less responsible actors around: * Creating a sense of artificial urgency, which causes people who are competitive and results driven to work harder and cut more corners * Providing a guiding star on which technical directions are promising (e.g. reasoning models, CoT, RLHF) * Legitimising irresponsible behaviour as valid response to strong competition ("it's a competitive market, this was bound to happen") * Entangling the motivations and incentives of the "more responsible" parties with the success of the technology in question, making any warnings seem weak and hypocritical ("if it's so bad, how come you're still doing it"?) * Providing an adversary or target to aim for/surpass (similar to artificial urgency) * Diffusing media/governance/public attention away from the "more irresponsible" parties, since it's now a multi horse race * Driving hype, attention, and funding to the field via your credibility and achievements * Becoming trapped in a "we must win" mentality that causes you yourself to cut corners
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
8 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Этот пост исследует замешательство автора относительно того, как нейронные сети, особенно большие языковые модели (LLM), выполняют и учатся вычислениям. Он подвергает сомнению традиционный подход к механической интерпретации, основанный на цепях, утверждая, что «цепи» и «вычисления» могут не быть наиболее подходящей основой для понимания LLM. Эссе обсуждает представительный дрейф как ключевую проблему для анализа цепей на основе весов и предлагает «ко-селекционистскую» точку зрения на цепи как возникающие единицы. Автор также размышляет о том, как концепция «универсальности» должна влиять на объяснения функционирования LLM.
6 дней назадDaily PapersВ статье исследуется линейность в больших языковых моделях (LLM), демонстрируя, что объединение входов из разных потоков текста приводит к суперпозиции распределений следующих токенов. Авторы предполагают, что эта линейность является врожденным свойством архитектуры Transformer и может быть восстановлена с помощью тонкой настройки, позволяя генерировать два согласованных продолжения за один проход.
4 дня назадDaily PapersВ статье представлена Taste-Bench — тест для оценки «вкуса» агента при принятии решений на длинных горизонтах. Она измеряет способность выбирать лучший путь на точках ветвления без знания будущих исходов, показывая, что современные модели плохо справляются, и что вкус можно улучшить с помощью дистилляции.
6 дней назадDaily PapersВ этой статье представлена FuseReg, метод, который заменяет эвристическую фьюзинг-фьюзинг в представительных автокодерах (RAE) обучением на случайных подмножествах слоев кодировщика. Подход уменьшает разрыв между реконструкцией и генерацией, повышая устойчивость к выбору фьюзинга слоев, достигая более высокого PSNR и более низких значений FID генерации без изменения предобученного кодировщика.
3 дня назадDaily PapersИсследование изучает JEV-as-a-Judge, экономичный метод оценки языковых моделей, основанный на уровнях уверенности, демонстрируя сравнимую производительность с ведущими судьями за долю стоимости. Подчеркивается, что JEV хорошо справляется со стандартными задачами, но испытывает трудности с сложными оценками, требующими глубокого анализа, но каскадная система, передающая сомнительные случаи, сохраняет большую часть точности при более низкой стоимости.
6 дней назадDaily PapersВ данной работе представлено StableVQ, метод повышения стабильности обучения векторно-квантованных токенизаторов, устраняющий взаимосвязь между обучением энкодера-декодера и кодовой книги. Предлагаются три ключевых компонента: Dynamic STE для стабилизации энкодера, Region VQ Loss для обучения кодовой книги и Decoupled Schedule для отдельных динамик оптимизации. Эксперименты на ImageNet показывают улучшение стабильности обучения, использования кодовой книги и качества восстановления.
6 дней назад