Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
21 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
This post argues that fixed-weight models (at least as we understand them today) will a) always be vulnerable to adversarial examples in their concept-spaces, and b) hence will be misaligned, under sufficient optimisation pressure. Boundaries in concept space To serve any purpose whatsoever, an AI will have to draw boundaries inside its world-model - to distinguish world A from world B, and reach some comparison between them. If we want the AI to follow our goals and values, we want it to be able to recognise concepts like "human being", or maybe "conscious being", "suffering", "preference satisfaction", and so on. So we want an AI to be able to look at a situation and assess, e.g., whether there are or aren't suffering conscious beings in it. But concepts like "conscious beings" are not crisply defined across all possible world-states. A fixed-weight model will draw a boundary between "conscious being" and "non-conscious being" (or maybe score the amount/degree of consciousness), but this will be an imperfect boundary. In high-dimensional spaces, there are many degrees of freedom of how a boundary can be drawn, and never enough data to draw the boundary perfectly[1]. If someone is confident that we can draw an acceptably reliable boundary defining "conscious being", grounded in fundamental facts about the universe (e.g. basic physics), and resistant to all ontological crises... well, let's just say they have an optimism about concept rigour that flies in the face of all past experience. Almost perfect decision boundaries. Almost... False positives and false negatives can both be disastrous: excluding conscious beings from consideration (therefore their suffering is ignored) or including non-conscious beings within the list (if smiling faces are ranked as conscious beings, then tiling the universe with smiling faces is an optimal action - even at the "minor" cost to those "humans and animals" running around). These examples are "adversarial", similarly to ad
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
21 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
позавчераLessWrongВ посте обсуждается напряжённость между исследованиями в области безопасности ИИ и возможностями, утверждая, что чрезмерное внимание к безопасности может ограничивать влияние исследований. Он анализирует историю исследований по интерпретируемости и предлагает стратегии для проведения исследований в области согласованности без вреда для возможностей.
4 дня назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
позавчераLessWrongАвтор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.
5 дней назадLessWrongСтатья обсуждает потенциальные риски архитектур, основанных на скрытом рассуждении, которые могут снизить эффективность метода Chain of Thought (CoT) для понимания ИИ. Она подчеркивает, что такие архитектуры могут позволить ИИ рассуждать в скрытых состояниях, а не через текстовый CoT, что затруднит контроль. Также упоминаются примеры, такие как COCONUT и полнополосные трансформеры, которые могут привести к такому изменению.
5 дней назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
8 часов назад