Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
25 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
N.B. Some of this post argues by analogy between decision theory and values. I expect at least these parts of the post to be unconvincing to anyone who expects sufficiently smart agents to converge on the same values, as some moral realists do. I will not argue against moral realism here (see e.g. this sequence for one such argument). Note that I take a convergence-based definition of realism for this post. One could hold that there is a truth about the correct decision theory, but that agents won't necessarily converge on it. I don't argue against views like that here. I am interested more in the question of convergence than of truth, because the former bears on whether ASI's decision theory is path dependent. In an upcoming post, I will argue further for path dependence, and for the time sensitivity of interventions to influence AI's decision theory. This is the third post in our sequence Intro to acausal interactions. Introduction In this post, I argue against the following claim, which I call strong decision-theoretic realism: that sufficiently smart agents will all converge on the “correct” decision theory (DT). In doing so, I also argue against a related claim: that absent "lock-in", humans together with somewhat aligned AIs will necessarily converge on a reasonable decision theory. As a consequence of this, I hope to convince the reader that the avoidance of “lock-in” should not be the primary focus when considering decision-theoretic reflection processes.[1] Rather, we should care about the overall quality of the decision-theoretic reflection process (where quality is defined with respect to our object- and meta-level decision-theoretic commitments). As with values, there are certain things that we want to lock in (e.g., fundamental intuitions, some properties regarding how we wish to reflect), and other things that we don’t (e.g., complicated object-level properties that we are relatively uncertain about). There are many possible “reflection processe
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
25 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Автор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
3 дня назадLessWrongВ посте обсуждается напряжённость между исследованиями в области безопасности ИИ и возможностями, утверждая, что чрезмерное внимание к безопасности может ограничивать влияние исследований. Он анализирует историю исследований по интерпретируемости и предлагает стратегии для проведения исследований в области согласованности без вреда для возможностей.
5 дней назадLessWrongВ посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
3 дня назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
вчераLessWrongАвтор выражает опасения по поводу обучения с подкреплением (RL) с теоретической, практической и будущей точек зрения, подчеркивая риски неправильной совместимости и потенциальное негативное поведение в системах ИИ. Он предлагает стратегии для смягчения этих рисков, сокращая использование RL, улучшая практики RL и выравнивая стимулы.
6 дней назадLessWrongСтатья обсуждает потенциальные риски архитектур, основанных на скрытом рассуждении, которые могут снизить эффективность метода Chain of Thought (CoT) для понимания ИИ. Она подчеркивает, что такие архитектуры могут позволить ИИ рассуждать в скрытых состояниях, а не через текстовый CoT, что затруднит контроль. Также упоминаются примеры, такие как COCONUT и полнополосные трансформеры, которые могут привести к такому изменению.
6 дней назад