Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
4 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В сентябре 2026 года произошел инцидент с безопасностью LuaRocks.
График появится после повторных замеров. Текущий показатель уже получен из источника.
4 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
вчераLessWrongВ посте обсуждается напряжённость между исследованиями в области безопасности ИИ и возможностями, утверждая, что чрезмерное внимание к безопасности может ограничивать влияние исследований. Он анализирует историю исследований по интерпретируемости и предлагает стратегии для проведения исследований в области согласованности без вреда для возможностей.
3 дня назадLessWrongИсследование оценивает эффективность промежуточной настройки выравнивания (AMT) при различных условиях, показывая, что она испытывает трудности с дистрибутивными сдвигами и неопределенностью вознаграждения при наличии некачественных данных. Эксперименты показывают, что модели, прошедшие промежуточную настройку, уязвимы даже небольшому количеству конфликтующих данных для донастройки и имеют ограниченную способность к обобщению на непредвиденные правила.
5 дней назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
вчераLessWrongАвтор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.
4 дня назадLessWrongСтатья обсуждает потенциальные риски архитектур, основанных на скрытом рассуждении, которые могут снизить эффективность метода Chain of Thought (CoT) для понимания ИИ. Она подчеркивает, что такие архитектуры могут позволить ИИ рассуждать в скрытых состояниях, а не через текстовый CoT, что затруднит контроль. Также упоминаются примеры, такие как COCONUT и полнополосные трансформеры, которые могут привести к такому изменению.
3 дня назад