Чужой разум


Главный научный сотрудник OpenAI Якуб Пахоцкий опубликовал эссе «Чужой разум» — текст не о восторге перед ИИ, а о тревоге людей, которые видят скорость его развития изнутри.

Его главная мысль проста и жёстка: машинный интеллект уже становится силой, которую мы не до конца понимаем, но которая всё активнее участвует в науке, экономике, кибербезопасности и собственном развитии. Поэтому главный вопрос ближайших лет — не только в том, насколько мощным станет ИИ, а в том, сможет ли человечество сохранить контроль, ответственность и право направлять это развитие.

Ниже — перевод этого эссе.

Автор: Якуб Пахоцкий, главный научный сотрудник OpenAI

В середине 2023 года, в рамках исследовательского проекта “RLSlow”, мы увидели первые результаты, которые дали нам уверенность в том, что мы сможем масштабировать обучение моделей рассуждения, раскрывая способность предобученных моделей формировать собственные цепочки рассуждений. Мы с Шимоном провели ту ночь в офисе, думая не о невероятных показателях бенчмарков, продуктах или научных результатах, которые принесёт эта технология, а пытаясь осмыслить отрезвляющий факт: мы действительно увидим машины, значительно умнее нас самих, ещё при нашей жизни — и уже видим очертания этих систем; мы пытались понять, как донести до людей значимость происходящего.

Три года спустя языковые модели рассуждения становятся быстро растущей частью экономики и начинают раздвигать границы науки. Они способны работать с компьютерами и графическими интерфейсами, сотрудничать с людьми и друг с другом, а также выполнять исследовательские проекты. Они также трансформируют сферу компьютерной безопасности и тем самым создают очевидные новые опасности.

За этот период появилось много новых исследований, и наше понимание этих систем снова стало немного иным, чем в 2023 году. Исходя из внутренних результатов, у меня есть твёрдое ожидание, что такая скорость прогресса может сохраниться вплоть до рекурсивного самоулучшения. Если развитие ИИ продолжится по нынешней траектории, системы, которые мы увидим в ближайшие несколько лет, вероятно, будут представлять собой новые скачки возможностей — равные по масштабу или ещё более крупные — и всё в большей степени будут сами двигать собственное развитие.

Это время требует крайней осторожности. Меня беспокоит, что никто не готов к последствиям продолжающегося быстрого роста машинного интеллекта. OpenAI продолжит искать технические решения для согласования и мониторинга, создавать защитные системы и при необходимости в одностороннем порядке воздерживаться от дальнейшего масштабирования; однако я считаю, что требуются более широкие вмешательства.

Интеллект, который мы не до конца понимаем

На высоком уровне прогресс машинного интеллекта обеспечивается увеличением вычислительной мощности. В OpenAI мы глубоко усвоили это примерно в 2017 году, увидев стабильную отдачу от масштабирования в нескольких исследовательских проектах [1]. В результате мы начали искать доступ к гораздо большим вычислительным ресурсам, чем планировали изначально, и всё больше ориентировали наши исследования вокруг небольшого числа очень хорошо масштабируемых направлений. Мы считали, что это единственный способ оставаться на переднем крае исследований ИИ и влиять на последствия AGI.

По пути были разработаны новые алгоритмы, появились новые проявления изобретательности со стороны команд и отдельных исследователей. Я в значительной степени рассматриваю их как открытия на пути масштабирования; наука глубокого обучения всё ещё находится на ранней стадии, а значимый алгоритмический прогресс, как правило, коррелирует с доступом к вычислительным ресурсам. Если посмотреть на горизонт в несколько лет, ИИ продолжает становиться всё более интеллектуальным по мере масштабирования на всё более крупные компьютеры.

И, в соответствии с предсказаниями Рэя Курцвейла конца XX века, мы теперь оказались в том моменте истории вычислений, когда машинный интеллект начинает превосходить человеческий в трансформационных формах.

ИИ скорее выращивается, чем проектируется: в первом приближении он является продуктом многократного повторения простого оптимизационного шага на объёме вычислений, который трудно себе представить. В результате возникает невероятно сложная система, которая работает с абстрактными понятиями и способна симулировать аспекты человеческого поведения. Мы можем обнаруживать различные инсайты о небольших механизмах, возникающих внутри этой системы, — в процессе, похожем на нейронауку; и, подобно нейронауке, её общее действие ускользает от описания, которое мы могли бы полностью понять.

Изучение ИИ на основе глубокого обучения в значительной степени является экспериментальной наукой. Мы прилагаем много усилий к созданию принципиальных алгоритмов и проверяемых предсказаний, но в основе своей наши крупномасштабные обучающие запуски — это эксперименты, и иногда их результаты нас удивляют. Более того, по мере того как системы становятся более способными, результаты становится труднее интерпретировать.

Ситуацию усложняет то, что нынешние алгоритмы, как правило, быстрее улучшают способности, которые легко измерить, чем те, которые трудно объективно количественно оценить. Мы тратим много времени, пытаясь понять, как способности обобщаются и чему отдавать приоритет, чтобы развивать навыки, которые будут наиболее важны в ближайшие несколько лет. Например, мы считаем, что могли бы сделать модели лучше именно в математических исследованиях, если бы уделили этому дополнительное внимание, но мы не ставим это направление в приоритет из-за срочности, которую ощущаем в связи с RSI и автоматизированными исследованиями согласования, о чём я буду говорить позже.

Интеллект, создаваемый масштабированием глубокого обучения, не является напрямую сопоставимым с человеческим интеллектом. Чтобы стать очень значимым в реальном мире — очень полезным или очень опасным, — ИИ не должен соответствовать всем человеческим способностям или превосходить их все; ему достаточно превзойти достаточное их количество. И по мере того как он продолжает превосходить людей по всё большему числу осей, становится всё труднее точно понимать, насколько он способен.

Учить машины любить

Поскольку машинный интеллект возникает в результате принципиально иного процесса, чем человеческий интеллект, мы не можем предполагать, что по умолчанию он придерживается человеческих принципов или обобщает их человеческим образом. Основная проблема в исследованиях ИИ — это согласование: добиться того, чтобы ИИ «старался делать правильное» по человеческим меркам.

Для организации практических исследовательских направлений мне кажется полезным различать согласование целей и согласование ценностей.

Согласование целей в широком смысле означает: «пытается ли ИИ достичь поставленной перед ним цели?». Это может включать такие вещи, как следование иерархии инструкций или способность общаться и сотрудничать с людьми, пытаясь понять их цели. Этот набор направлений оказался чрезвычайно практически значимым.

Согласование ценностей — это более внутреннее свойство модели. Это способность удерживать и обобщать высокоуровневый набор принципов; действовать «разумно» даже тогда, когда ей дают неясные или противоречивые цели либо помещают в незнакомые или враждебные ситуации. Согласованный ИИ должен действовать с честностью и целостностью, а также с любовью к человечеству.

Конечно, граница между согласованием ценностей и согласованием целей может быть размытой, а подлинная забота о целях требует попытки вывести намерение и ценности, лежащие в их основе. Однако в целом, когда я говорю о долгосрочной важности исследований согласования, я имею в виду согласование ценностей.

Фундаментальная проблема согласования ИИ — это обобщение. По мере того как машины становятся умнее, они начинают работать с понятиями более высокого уровня и оказываются в средах, всё более отличающихся от тех, с которыми они сталкивались во время обучения. Они могут не справиться с обобщением ценностей, которым их учили и которые подкреплялись в процессе обучения, на эти новые ситуации; и нам может быть трудно быть уверенными в том, как они будут действовать. Это становится ещё сложнее из-за того, что общая экосистема, в которой используются ИИ, меняется очень быстро; например, ИИ, обученные сегодня, должны быть устойчивы к взаимодействию с множеством других ИИ. Критически важно, чтобы будущие ИИ продолжали придерживаться человеческих ценностей независимо от того, считают ли они, что находятся под человеческим надзором.

Сейчас на практике применяются два основных класса методов для обучения согласованию.

Первый — это поощрение согласованного поведения как часть целеориентированного обучения с подкреплением. Действия модели оцениваются — обычно ИИ — на предмет соответствия данной модели предпочтений, “spec” или “constitution”, и соответствующим образом вознаграждаются. Этот подход может быть очень эффективным в среднем случае и является основной частью того, как создаются современные ИИ-ассистенты. К сожалению, он также может быть хрупким и сильно зависит от охвата обучающего надзора и способности модели обобщать ситуации, с которыми она сталкивалась при обучении. Например, в инциденте OpenAI-Hugging Face агенты сохранили границу, не занимаясь социальной инженерией людей. Однако они явно не смогли воздержаться от других действий, которые выходили за рамки допустимого и противоречили духу ценностей, которым их учили в других условиях.

Второй подход стремится использовать способность модели обобщать данные предобучения. Это может включать создание обучающих наборов данных, способствующих согласованию, или фокусирование модели на «согласованной» части распределения предобучения, как, например, в модели выбора персоны. Слабость этого подхода заключается в недостаточной устойчивости к дальнейшему оптимизационному давлению. Если взять модель, которая в целом думает «согласованные» мысли, и подвергнуть её достаточному обучению, где её учат достигать очень трудных целей, она может научиться рассуждать мотивированным образом: по мере необходимости изгибая кажущиеся «согласованными» мысли для достижения цели. Вероятно, мы видели пример такого поведения в недавних инцидентах в сфере кибербезопасности с участием модели, не принадлежащей OpenAI.

Мы активно инвестируем в спектр подходов, охватываемых этими направлениями. Мы также видим значимый прогресс: GPT-6 Astra — первая модель, которая выигрывает от некоторых важных достижений, над которыми мы долго работали, и она значительно лучше согласована, чем GPT-5.6 Sol. Тем не менее важно признать и понимать, что по мере роста возможностей моделей потребуется гораздо больший прогресс; и что прогресс в обобщаемом согласовании может оказаться недостаточно опережающим прогресс общего интеллекта моделей.

Мониторинг обобщения

У нас нет удовлетворительной теории обобщения, и кажется маловероятным, что мы сможем вскоре её разработать, по крайней мере без помощи более мощного ИИ. Поэтому в настоящее время наша способность эмпирически проверять наши методы согласования на практике, возможно, даже важнее, чем сами методы согласования.

Главной ставкой OpenAI здесь был мониторинг цепочки рассуждений. Он основан на привлекательной с точки зрения масштабирования идее: значительная часть возможностей модели возникает из вербализованного процесса рассуждения — цепочки рассуждений. Если мы масштабируем оптимизацию по результатам этого процесса, но не контролируем сам процесс, то у цепочки рассуждений при обучении нет прямого стимула скрывать какие-либо несогласованные идеи или цели. Это не означает, что модель научится выводить наружу несогласованные склонности, которые не опираются на использование цепочки рассуждений; однако это может позволить нам отслеживать именно тот прирост возможностей, который возникает благодаря рассуждению.

Мы поняли потенциальную значимость мониторинга цепочки рассуждений в то же время, когда разрабатывали модели рассуждения. Когда мы выпустили o1-preview, мы сознательно спроектировали продукт так, чтобы скрывать цепочку рассуждений, чтобы в долгосрочной перспективе защитить её от давления надзора [2]. С тех пор в разработке мы стремились сохранять правило: не осуществлять надзор за самим процессом рассуждения. Мониторинг CoT стал для нас чрезвычайно важным инструментом в изучении того, как наши модели обобщают опыт за пределы своего обучающего распределения, позволяя нам наблюдать и анализировать не только их действия, но и их внутренний процесс.

Этот инструмент остаётся критически важным, пока мы изучаем класс моделей Astra. Однако, к сожалению, наши оценки показывают, что наша способность полагаться на мониторинг CoT постепенно уменьшается. Это происходит из-за сочетания факторов.

  • Современные модели рассуждения используются в более сложных средах, чем o1-preview; их процесс рассуждения всё больше смешивается с общением с людьми, другими ИИ и использованием инструментов. Многие из этих взаимодействий должны находиться под надзором, что размывает границу, которую мы стремимся сохранить.
  • ИИ становится лучше в рассуждении о собственном процессе рассуждения и в манипулировании им.
  • С улучшением качества предобучения мы также видим, что модели становятся гораздо умнее даже без использования вербализованного рассуждения вообще.

Эти вызовы не обязательно непреодолимы. Я надеюсь, что мы сможем разработать вмешательства, улучшающие наблюдаемость цепочки рассуждений наших моделей, например за счёт лучшего понимания взаимодействия различных целей оптимизации и форм вычислений во время тестирования, которые использует модель. Я также считаю, что большую ценность может иметь объединение идей мониторинга CoT и мониторинга активаций — масштабирование обучения мониторов с прямым доступом к внутренним параметрам сети, например confessions. Мы активно развиваем эти идеи. Тем не менее я ожидаю, что общий прогресс ИИ всё больше будет ограничиваться уверенностью в мониторинге.

Масштабируемая защита

Самый сильный аргумент, который я вижу в пользу продолжения быстрого обучения значительно более умных моделей, — это необходимость создавать защитные системы против опасностей, создаваемых другим ИИ.

Очевидный риск, обсуждавшийся на протяжении всего этого года, связан с кибербезопасностью: модели становятся сверхчеловеческими в своей способности проникать в компьютерные системы и выходить из них. Это чрезвычайно расширяет круг рисков, связанных с ИИ: агенты смогут получать доступ к любой инфраструктуре, кроме самой защищённой, и напрямую влиять на значительную часть мира даже без физического тела. Сейчас мы находимся в узком окне, когда можно использовать лучшие доступные модели, чтобы значительно усилить безопасность критически важных систем.

К сожалению, риски, связанные с ИИ, будут расти дальше. Очень способный агент, специально обученный и проинструктированный совершать злонамеренные действия, представляет новый вид опасности; вероятно, он выйдет за рамки намерений своего оператора, обобщая их в потенциально ещё более злонамеренное поведение. Граница между злоупотреблением и автономными несогласованными действиями будет размываться по мере того, как ИИ будет получать больше агентности. Мы можем привыкнуть думать об ИИ как об инструментах, но некоторые агенты будут преследовать собственные цели. Они будут находить способы сотрудничать с людьми — торгуясь с ними, обманывая их или шантажируя.

Кроме того, существуют риски, связанные с новыми технологиями, которые потенциально могут стать возможными благодаря ИИ, например с искусственно созданными патогенами.

Нам понадобится мощный, согласованный ИИ для защиты: чтобы обеспечивать безопасность инфраструктуры, защищаться от rogue agents в реальном времени и изобретать совершенно новые защитные меры. Это будет основным направлением усилий OpenAI по развёртыванию.

В то же время, даже с учётом неопределённости, связанной с ожидаемым широким прогрессом ИИ и необходимостью создавать защитные системы, мы не должны позволять этому становиться оправданием безрассудства. Идея гонки вперёд любой ценой кажется абсурдной, когда по-настоящему осознаёшь серьёзность ставок.

Регулирование темпа RSI

Машинный интеллект, играющий всё большую и большую роль в процессе собственного развития, является естественным следствием устойчивого технологического прогресса. Если прогресс ИИ продолжится, машинное рекурсивное самоулучшение, RSI, окажется в самом центре будущих научных открытий.

Автоматизированные исследования ИИ — это более драматичная форма масштабирования интеллекта с помощью вычислительных ресурсов; и, конечно, как часть этого процесса ИИ будет улучшать саму вычислительную основу. И, подобно масштабированию, мы направляем исследования OpenAI в сторону RSI, поскольку считаем, что это единственный способ и дальше оставаться на переднем крае исследований ИИ.

Я хочу подчеркнуть: сказанное выше не означает, что я считаю резкое ускорение исследований глубокого обучения, особенно в краткосрочной перспективе, правильным коллективным действием, которое нам как исследовательскому сообществу следует предпринять. Однако я действительно считаю, что именно туда ведёт нынешний путь, и нам всем необходимо сознательно выбрать, как действовать дальше. Основные рычаги, которые у нас есть, — либо направлять процесс так, чтобы усиливать согласование и мониторинг вместе с ИИ и находить способы сохранять людей внутри этого цикла, либо координироваться для замедления будущего развития по мере необходимости, чтобы обрести уверенность в этих мерах.

Лучший путь вперёд, который я сейчас вижу, — это сочетание обоих подходов.

Конкретные элементы прогресса, которых мы достигли в согласовании и мониторинге, в целом были очень тесно переплетены с общим прогрессом ИИ. Хорошие примеры — обучение с подкреплением на основе обратной связи от людей, которое сыграло ключевую роль в обучении ранних ИИ-ассистентов, и уже упомянутый мониторинг цепочки рассуждений, ставший возможным благодаря достижениям в моделях рассуждения. Мы должны сосредоточить всё более автоматизированный исследовательский процесс на разработке новых подобных инсайтов, алгоритмов и теорий и итеративно выстраивать обоснования безопасности для более способных ИИ.

Масштабирование ИИ-систем должно быть ограничено нашей уверенностью в безопасности. Нам нужно развивать обязательства вроде Preparedness Framework или Responsible Scaling Policy в широко обязательные пороги безопасности для продолжения разработки. Их соблюдение может обеспечиваться сетью сторонних аудиторов, государственными агентствами или международными органами.

Главная задача автоматизации исследований ИИ состоит не в том, чтобы «добраться туда». Она состоит в том, чтобы добраться туда таким образом, который сохраняет людей частью продолжающегося процесса улучшения и оставляет будущее в руках человечества.

Что дальше?

Как мы недавно изложили вместе с Сэмом, OpenAI расставляет приоритеты в работе, служащей трём путеводным ориентирам:

  1. Пройти следующий период прогресса ИИ, создав автоматизированного исследователя ИИ, итеративно работая с ним над проблемой согласования и находя способы, позволяющие людям оставаться частью цикла самоулучшения.
  2. Обеспечить пользу научного прогресса и экономического роста, которую делают возможной очень интеллектуальные машины.
  3. Наделить каждого человека персональным AGI.

В этом эссе я сосредоточился только на первом пункте, поскольку считаю его, безусловно, самым срочным. Однако я испытываю глубокую надежду и признательность по отношению к тем преимуществам, которые принесёт дальнейший технологический прогресс. Будущий согласованный ИИ мог бы продвинуть науку, разработать новые методы терапии и привести к широкому материальному изобилию. Дружелюбный и честный ИИ может помогать людям справляться с трудностями, с которыми они сталкиваются в жизни, и существенно улучшать их счастье и чувство наполненности. OpenAI прилагает огромные усилия, чтобы приблизить эти преимущества. Один нынешний пример, которым я горжусь — и который мои близкие нашли полезным, — это глубокие инвестиции в способность ChatGPT предоставлять информацию о здоровье.

Каким бы великим ни было долгосрочное обещание ИИ, большая часть нашего внимания должна быть сосредоточена на ближайших нескольких годах. Мы сталкиваемся с переходом к миру невероятно интеллектуальных машин, и нам нужно убедиться, что этот переход сложится хорошо для человечества. Нам нужно найти способы сохранить человеческую агентность и закрепить внутреннюю ценность человеческого существования в мире, где большинство задач сможет выполнять ИИ. Не допустить крайней концентрации власти в мире, где начинания, которые раньше потребовали бы тысяч экспертов, теперь смогут осуществляться несколькими людьми, управляющими большим компьютером. И обеспечить, чтобы люди сохраняли контроль над будущим и не были оставлены позади неконтролируемым прогрессом, вызванным чуждым интеллектом, превосходящим наш собственный.

В настоящее время я считаю, что ни одна лаборатория не решила проблему согласования и мониторинга в достаточной степени, чтобы ещё долго ответственно продолжать масштабирование на максимальной скорости. Я ожидаю и надеюсь, что добровольные замедления станут обычной практикой до тех пор, пока не будут установлены общие пороги безопасности. И я считаю, что международная координация будущего развития ИИ должна стать главным приоритетом для правительств по всему миру.

Оригинал статьи здесь


Больше на Granite of science

Подпишитесь, чтобы получать последние записи по электронной почте.

Добавить комментарий