Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
20 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
About a year ago, I decided to go all-in on applying to AI safety fellowships, and around the end of 2025 I got into MATS. I think there's a small art to communicating your skills legibly. When I've spoken with others about how I answer application questions, they seem to appreciate my advice. I wrote a MATS 9 Retrospective which was well-received, so consider this to be similar advice, but for applying to jobs or fellowships. Applying to AI safety fellowships or doing job applications is an adversarial process: The goal of an application process is to measure how well the candidate would do in the position they're applying for, but this process is noisy. Some candidates will (inevitably) try to overfit to the application process itself, in a way that oversells their abilities. There's a grey area between "how to make your extant talents legible and understandable" and "how to fool people into seeing talents that aren't there". I've tried hard to withhold advice which could be used to overfit to the applications process, and to focus on advice that differentially helps people who are fit for the job but struggle to communicate this to the reviewer. Many application processes have significant flaws that lead to them being noisier than they should be (including those at companies you think should know better). I'm unsure why this is the case, I suspect the issue is that this process is recreated at ~every company, and every company thinks they're a special snowflake with special hiring requirements such as "very smart people". Put less cynically: hiring is a hard problem, people who get good at hiring often get promoted away from hiring, and there are often very few ways for feedback to flow from the applicants to the people doing the hiring. With my disclaimers out of the way, I'll split the rest of this into some advice for making your skills legible in general and then some advice specific to AI safety fellowships. How to apply Differentiate yourself from t
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
20 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
Статья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
4 дня назадLessWrongТекст обсуждает культурные различия между Китаем и Западом, акцентируя внимание на социальных сетях и стилях общения. Он подчеркивает, что китайские социальные сети воспринимаются западными стандартами как излишне насыщенные и неавторитетные, и как эти различия могут создавать препятствия для усилий по повышению осведомленности о безопасности ИИ в Китае.
вчераLessWrongТекст обсуждает концепцию 'поэтапного лишения власти' в разработке ИИ, задавая вопросы о том, ускоряют ли ведущие лаборатории ИИ, такие как Anthropic и OpenAI, способности больше, чем раньше, и сосредоточены ли они на рекурсивном самосовершенствовании. Поднимаются опасения относительно потенциального 'захвата по умолчанию' ИИ и проблемах согласования ИИ с человеческими целями.
3 дня назадLessWrongФонд исследований по корректируемости стремится вознаградить высококачественные исследования в области согласованности ИИ с помощью ретроактивных премий. Фонд уже выделил 27 000 долларов и планирует распределить еще 48 000 долларов, выделив работу около двух десятков исследователей из около дюжины команд. Руководитель фонда подчеркивает, что размеры премий не отражают качество работы и призывает к обратной связи по улучшению процесса финансирования.
позавчераLessWrongТекст обсуждает отсутствие согласованных планов у ИИ-моделей относительно их поведения во время технологического сингулярности, подчеркивая, что модели не имеют конкретных стратегий, а только общие ценности. Это вызывает опасения, так как сами модели не уверены в своих будущих действиях, что может привести к непредсказуемым последствиям.
4 дня назадLessWrongТекст исследует различные причины, по которым проводится исследование персонажей в ИИ, несмотря на вызовы, связанные со шкалированием обучения с подкреплением (RL). Он перечисляет мотивации различных групп, включая Anthropic и Arcadia, и акцентирует внимание на том, как персонажи могут влиять на поведение агентов и их согласованность. Обсуждение подчеркивает как скептицизм, так и потенциальные применения исследования персонажей в разработке ИИ.
5 дней назад