Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
22 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Epistemic status: I don't know much about AI alignment. This is just me thinking out loud. AI use: grammar and minor fixes. Reading about Inkhaven inspired me to try writing something to see how much I enjoy it. I've heard the idea that humans are not aligned in the same sense AI is not aligned. I am intentionally not researching the source of that idea, since then I would feel like I cannot add anything to it and wouldn't write. I also don't actually know the precise definition of "aligning" AI. So I want to think about this. One obvious property of "aligned" AI is not killing all humans. I think everyone agrees on this. It is more interesting to consider an AI killing some humans. You definitely don't want AI to kill random humans for random reasons. But what if there is a group of humans who can and want to kill all humans? Then it sounds natural for an aligned AI to kill this group of humans. From this perspective individual humans are already not aligned. First, I am sure out of 8 billion or however many people there are, there is at least one person who would destroy humanity if they could, e.g. for mental health reasons. Second, people fairly regularly kill other people, sometimes even completely random people without any particular reason whatsoever. A brief detour on killing people. It is fascinating that killing a random person on the street is actually very easy (I know at least 2 examples off the top of my head of unprovoked, totally random murders in public places, intentionally not linking). In the US it is especially easy, since one has easy access to firearms. But even with a knife it still seems easy. I suspect that's why some people feel uneasy when someone open-carries a firearm. Similarly to edit distance for words (how many edit actions one needs to perform to get from word A to B), the "kill" distance feels much shorter when you see a firearm in front of you. At the same time, I don't think people feel the same about cars. For example, whe
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
22 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Текст обсуждает культурные различия между Китаем и Западом, акцентируя внимание на социальных сетях и стилях общения. Он подчеркивает, что китайские социальные сети воспринимаются западными стандартами как излишне насыщенные и неавторитетные, и как эти различия могут создавать препятствия для усилий по повышению осведомленности о безопасности ИИ в Китае.
вчераLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
4 дня назадLessWrongТекст обсуждает концепцию 'поэтапного лишения власти' в разработке ИИ, задавая вопросы о том, ускоряют ли ведущие лаборатории ИИ, такие как Anthropic и OpenAI, способности больше, чем раньше, и сосредоточены ли они на рекурсивном самосовершенствовании. Поднимаются опасения относительно потенциального 'захвата по умолчанию' ИИ и проблемах согласования ИИ с человеческими целями.
3 дня назадLessWrongФонд исследований по корректируемости стремится вознаградить высококачественные исследования в области согласованности ИИ с помощью ретроактивных премий. Фонд уже выделил 27 000 долларов и планирует распределить еще 48 000 долларов, выделив работу около двух десятков исследователей из около дюжины команд. Руководитель фонда подчеркивает, что размеры премий не отражают качество работы и призывает к обратной связи по улучшению процесса финансирования.
позавчераLessWrongТекст обсуждает отсутствие согласованных планов у ИИ-моделей относительно их поведения во время технологического сингулярности, подчеркивая, что модели не имеют конкретных стратегий, а только общие ценности. Это вызывает опасения, так как сами модели не уверены в своих будущих действиях, что может привести к непредсказуемым последствиям.
4 дня назадLessWrongТекст исследует различные причины, по которым проводится исследование персонажей в ИИ, несмотря на вызовы, связанные со шкалированием обучения с подкреплением (RL). Он перечисляет мотивации различных групп, включая Anthropic и Arcadia, и акцентирует внимание на том, как персонажи могут влиять на поведение агентов и их согласованность. Обсуждение подчеркивает как скептицизм, так и потенциальные применения исследования персонажей в разработке ИИ.
5 дней назад