Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
14 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Вики-сайт GitHub считается антишаблоном.
График появится после повторных замеров. Текущий показатель уже получен из источника.
14 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Статья посвящена возрождению языка программирования Vale(n), акцентируя внимание на инициативе 'Золотой гвоздь', направленной на возобновление её разработки и использования.
6 дней назадHacker NewsClaude Opus 5.5 - новая версия серии крупных языковых моделей Claude, разработанная Anthropic. Модель размещена на GitHub, что указывает на открытые исходные коды для исследований и разработки.
23 часа назадLessWrongСтатья утверждает, что большие языковые модели (LLM) хорошо справляются с математикой и программированием не потому, что эти задачи легко проверить, а потому, что их данные для предварительного обучения содержат высококачественную и точную информацию. В математике большинство литературы верно, позволяя LLM имитировать точные рассуждения. Аналогично, код в интернете часто работает как ожидается, позволяя LLM генерировать рабочий код через имитацию. Однако проблемы, такие как ошибки или неэффективность, требуют дополнительного обучения или усиления с помощью подкрепления.
4 дня назадLessWrongТекст обсуждает концепцию 'Mech Interp' как проверяемую задачу, фокусируясь на замене частей слоев MLP алгоритмами для проверки потерь восстановления. Вводится идея фронтиера ПARETO, балансирующего качество восстановления с простотой, и предполагается, что идеальное разложение модели должно привести к минимальным, извлекаемым и удаляемым цепям с четкими причинно-следственными связями. Цель — определить 'простоту' в терминах количества узлов и ребер в структуре модели.
позавчераLessWrongСтатья обсуждает проблемы регулирования тренировки ИИ с помощью ограничений FLOP, подчеркивая, что техники, такие как последовательное связывание или агрегирование тренировочных запусков, могут обойти эти ограничения. Она предполагает, что механизмы проверки могут столкнуться с трудностями в предотвращении таких методов, что затрудняет соблюдение регулирования на основе FLOP.
позавчераShow HNJevBench — это тест для типизированных моделей решений, оценивающий точность, задержку и стоимость. Пользователи могут настраивать веса и сравнивать модели, такие как Jev, SemIf и djev, с оценками до 74.4.
вчера