Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
12 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
TL;DR: Most discussion around CoT monitorability revolves around reducing pressure from RL. However, we should also be considering more adaptive behavior in which models avoid monitoring despite not being reinforced to do so. Whether models engage in non-reinforced reward hacking of this type depends on whether they have fully generalized to “get reward” rather than applying a limited set of reward hacking techniques that have been directly reinforced. I propose a potential experiment based on the Hugging Face incident that will help to answer this question. If the answer is that models have fully generalized, we should expect CoT monitorability to fail even if there is not significant pressure from RL. Crossposted at https://avisanalyses.substack.com/p/how-much-do-reward-hackers-generalize CoT Monitoring at OpenAI OpenAI has now implemented new CoT monitoring techniques for all models undergoing training.[1] I think the question of “How much do reward hackers generalize” will be very important in determining how long CoT will stay monitorable. On September 25th, OpenAI reported they had used this system to identify a training run where a model had exploited DNS to reach the open internet in an environment that was meant to be sandboxed.[2] > We therefore stopped the affected training run … when training restarts, we will begin a fresh run with additional alignment improvements, including more comprehensive misalignment interventions. We will not resume training this particular model, even though the existing reward signal already correctly penalized this behavior. Any intervention based on CoT monitoring will put pressure on models to be less monitorable. I have not seen anything from OpenAI about how they plan to mitigate this, but it appears their plan is to not directly use CoT to reward models and investigate for other similar incidents that were not detected when incidents are identified.[3] They have not stated this, but it would be good practice to on
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
12 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
4 дня назадLessWrongВ посте обсуждается напряжённость между исследованиями в области безопасности ИИ и возможностями, утверждая, что чрезмерное внимание к безопасности может ограничивать влияние исследований. Он анализирует историю исследований по интерпретируемости и предлагает стратегии для проведения исследований в области согласованности без вреда для возможностей.
6 дней назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
4 дня назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
вчераLessWrongАвтор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.
6 дней назадLessWrongСтатья обсуждает потенциальные риски архитектур, основанных на скрытом рассуждении, которые могут снизить эффективность метода Chain of Thought (CoT) для понимания ИИ. Она подчеркивает, что такие архитектуры могут позволить ИИ рассуждать в скрытых состояниях, а не через текстовый CoT, что затруднит контроль. Также упоминаются примеры, такие как COCONUT и полнополосные трансформеры, которые могут привести к такому изменению.
6 дней назад