Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
23 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Scientific progress and its perils. TLDR: The vulnerable world hypothesis is likely correct. Once enormous amounts of cognitive labor start getting applied to basic science, it will quickly become apparent how many avenues exist to create cheap, ultradestructive weapons technology. Solving this problem without global preventative policing (e.g. AI nonproliferation) is impossible, because hardening civilians against all avenues of attack is too expensive and will take too long. Rather than sell policymakers on politically popular marginal hardening plans, we should focus on the core of the problem (the proliferation of AI technology and the externalities of speeding up scientific research) and propose strategies for safely monopolizing international AI development. Argument as follows: 1. AI is going to get cheaper and enable new offensive technologies. 2. To solve this problem, you can either: a) restrict access to dual-use AI systems, or b) accelerate defensive investment and proactively harden society. 3. If you accelerate defensive investment enough, you can avoid the concentration of power risks of monopolizing access to superintelligence. 4. Actually doing that would be extremely hard. You would need to design and scale defensive technology fast enough that there isn't a danger period during which you need monopolization, across all offensive technologies AI could enable. 1. Ergo, we can't rely on hardening and will have to figure out monopolization. Why so hard? 1. Lots of actors will want to acquire and abuse offensive technologies. Even if you stop terrorists, misaligned AIs and rogue states will still be willing (and much more capable) of acquiring and abusing superweapons. 2. Comprehensively defending society against future technologies will be hard for the same basic reasons nuclear defense is worthless today. 1. Civilians are fundamentally fragile targets: they're soft, they can't be hidden, and they depend on external infrastructure to
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
23 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
3 дня назадLessWrongВ посте обсуждается напряжённость между исследованиями в области безопасности ИИ и возможностями, утверждая, что чрезмерное внимание к безопасности может ограничивать влияние исследований. Он анализирует историю исследований по интерпретируемости и предлагает стратегии для проведения исследований в области согласованности без вреда для возможностей.
5 дней назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
3 дня назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
вчераLessWrongАвтор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.
6 дней назадLessWrongСтатья обсуждает потенциальные риски архитектур, основанных на скрытом рассуждении, которые могут снизить эффективность метода Chain of Thought (CoT) для понимания ИИ. Она подчеркивает, что такие архитектуры могут позволить ИИ рассуждать в скрытых состояниях, а не через текстовый CoT, что затруднит контроль. Также упоминаются примеры, такие как COCONUT и полнополосные трансформеры, которые могут привести к такому изменению.
6 дней назад