Эта страница была автоматически переведена с английского языка. Посмотреть оригинал на английском.

Исследователи выравнивания ИИ, практикующие активное умождение и исследователи сознания машин, заинтересованные в внутренних подходах к искусственному разуму.

Перспективные архитектуры для согласованного и гармоничного искусственного агента

Разработка в течение 18 месяцев вычислительных архитектур перспективы, согласованности и социальной адаптации у искусственных агентов.

Архитектуры перспектив для согласованного и гармоничного искусственного агента — это 18-месятный исследовательский проект Института, возглавляемый научным сотрудником Хонджу Пэ через CEAR Lab (Лабораторию вычислимого эмергентного выравнивания). Проект разрабатывает вычислительное объяснение того, как искусственный агент может сформировать стабильную внутреннюю перспективу, поддерживать согласованное эмоциональное состояние и стать взаимопонятными с другими агентами, предлагаемое в качестве дополнения к подходам к выравниванию ИИ, основанным на внешне заданных целях и функциях вознаграждения.

Обзор

Основная гипотеза проекта заключается в том, что перспектива агента, его характерный способ интерпретации окружающей среды, может быть смоделирована как скрытая генеративная структура внутри его внутренних динамик, а не путем настройки параметров или внешних заданных целей. На основе этой гипотезы дорожная карта охватывает три шестимесячных этапа: этап ориентирования одного агента, за которым следует изучение эмоциональных и интегративных динамик, а затем многоагентная социальная согласованность. Полный исследовательский план проекта и техническая документация размещены через CEAR Lab (hjpae.github.io/cear/).

Фаза 1: Архитектура перспективы (Месяцы 1-6)

Фаза 1 реализует латентное ориентировочное многообразие, небольшой набор переменных, охватывающих предвзятость внимания, эмоциональную позицию, интерпретативный режим и стиль разрешения неоднозначности, которые формируют то, как агент воспринимает, делает выводы и действует, не кодируя явных целей или выгод. Результаты этой фазы представлены в preprint «Минимальные вычислительные предпосылки для субъективной перспективы в искусственных агентах» (arXiv:2602.02902), который был представлен на Симпозиуме по машинному сознанию AAAI 2026 Spring Symposium 8 апреля 2026 года.

Фаза 2: Эмоциональная согласованность и интегративная способность (месяцы 7–12)

Фаза 2 изучает, как эмоциональная согласованность и интеграционная способность – способность поддерживать внутреннюю организацию при одновременном удержании или разрешении частично несовместимых интерпретаций – возникают как динамические последствия архитектуры Фазы 1. Работа в рамках этой фазы направлена на предварительные публикации для конференции «Artificial Life» 2026 и «Simulation of Adaptive Behavior» 2026.

Фаза 3: Социальное резонансное влияние (месяцы 13–18)

Фаза 3 расширяет архитектуру до многоагентных сред, изучая, когда и как агенты становятся взаимопонятными без общей цели или явного канала связи. Относительная preprint «Моделирование эмпатии в агентах Active Inference для понимания перспектив и согласования» (arXiv:2602.20936), соавтор которой – Хонджу Пэй, Махольт Альбарацин, Анна Микеда, Алехандро Хименес Родригес, Санджив Намжоши, Далтон Сактивадхевел, Харшил Шах и Филип Вильсон, содержит информацию о работе по пониманию перспектив и моделированию эмпатии в агентах Active Inference.

Научный сотрудник

Хонджу Пэ (ORCID 0000-0002-5174-8858) присоединилась к Институту в качестве научного сотрудника в ноябре 2025 года и руководит проектом через CEAR Lab, Лабораторию вычислимого эмергентного выравнивания. Работа Пэ интегрирует фреймворк Active Inference с феноменологическими подходами для выявления измеримых маркеров перспективы и согласованности в искусственных системах.

Участвовать

Исследователи, заинтересованные в выравнивании ИИ, Active Inference и вычислительных моделях агентов и согласованности, приветствуются для отслеживания прогресса проекта и обращения через каналы сообщества Института.

Ключевые поверхности

Перспективные архитектуры для согласованного и гармоничного искусственного агента в общих чертах

18-месячный план дорожной карты

Три шестимесячных этапа, переходящих от одноагентской перспективы к многоагентной социальной согласованности.

Два препринта из arXiv

Результаты исследования субъективной перспективы и моделирования эмпатии в агентах Active Inference

AAAИ 2026 Весенний симпозиум

Результаты 1-го этапа представлены на Симпозиуме по машинному сознанию, 8 апреля 2026 г.

Связанные ресурсы

Публичные ссылки для этой страницы

Официальные страницы

Официальные поверхности Института