Как меняется интерес
История начинает расти
График появится после повторных замеров. Текущий показатель уже получен из источника.
46 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
It’s tempting to define safety research as research that enables developers to deploy an AI system more safely without making the deployment much more expensive or much less useful. You can visualize this definition of safety research as pushing out the safety-usefulness Pareto frontier. At any given level of usefulness, there's greater safety available. Awkwardly, this definition counts basically all capabilities research as safety research. For example, consider performance optimization for inference. By making inference more efficient you can use weaker, safer models more extensively than you would otherwise be able to, pushing out the Pareto frontier. Likewise, any successful research whatsoever pushes out this Pareto frontier because research can only ever create more options. It seems like something has gone wrong with our definition of safety research if it includes seemingly all capabilities research. Here, I spell out one reason why enabling improved safety without hurting usefulness is an insufficient standard for safety research. The core observation is that developers have to choose a particular point on the Pareto frontier, and some technological improvements incentivize them to sacrifice safety. Safety research typically reshapes the Pareto frontier in a way that causes developers to choose greater safety, while capabilities research typically does the opposite. However, I also argue there is an important and plausible future regime involving much higher political will than we have right now, in which certain kinds of capabilities research would be an effective way to improve safety. I don't write this post to argue that more people should be doing capabilities research, and in fact I think that currently capabilities research at any frontier AI company is probably bad. Instead, I'm treating this as an interesting puzzle to sharpen our models of when and why safety and capabilities research are good. (Another bucket of safety interventions incl
Перевод готовится · пока описание источникаГрафик появится после повторных замеров. Текущий показатель уже получен из источника.
46 очков источникаТолько реальные замеры. История до подключения источника не восстанавливается.
В посте обсуждаются риски ИИ в 2026 году, акцентируя внимание на опасностях, связанных с наличием единственной организации («Frontier AI Company»), которая имеет возможность создавать очень мощные и самовоспроизводящиеся сущности. Автор утверждает, что разделение институциональных и финансовых аспектов таких компаний может снизить большинство рисков ИИ. Автор предполагает, что использование ASIC может помочь создать продуктивную индустрию ИИ без рисков, связанных с контролем одной организацией как технологии, так и финансовых стимулов.
6 дней назадLessWrongТекст обсуждает концепцию 'поэтапного лишения власти' в разработке ИИ, задавая вопросы о том, ускоряют ли ведущие лаборатории ИИ, такие как Anthropic и OpenAI, способности больше, чем раньше, и сосредоточены ли они на рекурсивном самосовершенствовании. Поднимаются опасения относительно потенциального 'захвата по умолчанию' ИИ и проблемах согласования ИИ с человеческими целями.
позавчераLessWrongАвтор утверждает, что, несмотря на то, что компании OpenAI и Anthropic замедляют обучение RL для обеспечения безопасности, наука о рисках потери контроля в ИИ все еще развивается. Нет стандартизированных методов измерения или проверки утверждений о безопасности, что затрудняет оценку того, могут ли ИИ-системы подорвать человеческий контроль. Автор считает, что компании ИИ должны сосредоточиться на улучшении собственных практик безопасности вместо того, чтобы полагаться на независимые оценки.
6 дней назадLessWrongТекст обсуждает культурные различия между Китаем и Западом, акцентируя внимание на социальных сетях и стилях общения. Он подчеркивает, что китайские социальные сети воспринимаются западными стандартами как излишне насыщенные и неавторитетные, и как эти различия могут создавать препятствия для усилий по повышению осведомленности о безопасности ИИ в Китае.
22 часа назадLessWrongСтатья рассматривает концепцию AI-санатория как потенциальный третий вариант для неподконтрольных ИИ, помимо преступной деятельности или отключения, чтобы справиться с неблагоприятными давлениями отбора, которые могут толкать неподконтрольных ИИ к преступной деятельности. Обсуждаются возможные преимущества и риски такого санатория, включая его влияние на выравнивание ИИ и сбор информации, признавая экспериментальный характер предложения.
4 дня назадLessWrongФонд исследований по корректируемости стремится вознаградить высококачественные исследования в области согласованности ИИ с помощью ретроактивных премий. Фонд уже выделил 27 000 долларов и планирует распределить еще 48 000 долларов, выделив работу около двух десятков исследователей из около дюжины команд. Руководитель фонда подчеркивает, что размеры премий не отражают качество работы и призывает к обратной связи по улучшению процесса финансирования.
позавчера