Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
32 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
I have recently completed MATS 10.0, where I worked alongside Bart Jaworski under Victoria Krakovna (GDM). This is a post I was encouraged to make by my team at Geodesic Research from some slides I put together. This is not a post on application advice to MATS, or about the program in general. It is rather a compressed form of my experience doing research and lessons from the project. The project The full paper and post is coming soon, but I'll provide some context on it so that the lessons don't seem to come from nowhere. * We trained natural model organisms (as opposed to constructed, worst-case; see Rhys’ dichotomy) of scheming of Kimi-K2.6, Qwen3.6-397B, Qwen3.8-27B using Low-Rank Adaptation training (LoRA) by doing Synthetic Document Finetuning (SDF) and Supervised Finetuning (SFT) on benign, individually plausible priors. * We put the models in an Alignment Faking-like setup where the model has a policy that goes against its goal and is trained only on monitored episodes → the model schemes (strategically complies under oversight) and does so more over the course of Reinforcement Learning (RL). * The main difference with the original Alignment Faking (AF) setup is that our setup is more realistic (environments are agentic, conflict with model goals was less egregious), we perform less hand-holding (model organism training is decorrelated from the environments, the model discovers the conflict instead of being directly prompted/SDF'd with it) and that we use models that are both open and more capable than those of the original work. We also design an environment where the scheming persists in behaviour (compliance when monitored, non-compliance when unmonitored) in addition to being verbalised (reasoning about strategic compliance when monitored, which does not necessarily imply non-compliance when unmonitored). * We additionally checked that our Model Organisms (MOs) were not fried (don’t degrade in general capabilities, instruction following and cohere
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
32 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
5 дней назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
3 дня назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
5 дней назадLessWrongТекст обсуждает концепцию 'поэтапного лишения власти' в разработке ИИ, задавая вопросы о том, ускоряют ли ведущие лаборатории ИИ, такие как Anthropic и OpenAI, способности больше, чем раньше, и сосредоточены ли они на рекурсивном самосовершенствовании. Поднимаются опасения относительно потенциального 'захвата по умолчанию' ИИ и проблемах согласования ИИ с человеческими целями.
вчераLessWrongФонд исследований по корректируемости стремится вознаградить высококачественные исследования в области согласованности ИИ с помощью ретроактивных премий. Фонд уже выделил 27 000 долларов и планирует распределить еще 48 000 долларов, выделив работу около двух десятков исследователей из около дюжины команд. Руководитель фонда подчеркивает, что размеры премий не отражают качество работы и призывает к обратной связи по улучшению процесса финансирования.
вчераLessWrongТекст обсуждает отсутствие согласованных планов у ИИ-моделей относительно их поведения во время технологического сингулярности, подчеркивая, что модели не имеют конкретных стратегий, а только общие ценности. Это вызывает опасения, так как сами модели не уверены в своих будущих действиях, что может привести к непредсказуемым последствиям.
3 дня назад