Эта страница была автоматически переведена с английского языка. Посмотреть оригинал на английском.

Исследователи выравнивания ИИ, практики Active Inference и исследователи машинного сознания, заинтересованные в интерналистских подходах к искусственной агентности.

Перспективные архитектуры для согласованного и гармоничного искусственного агента

Разработка в течение 18 месяцев вычислительных архитектур перспективы, согласованности и социальной адаптации у искусственных агентов.

Архитектуры перспективы для когерентного и настроенного искусственного агента» — это 18-месячный исследовательский проект Института, возглавляемый Research Fellow Хонджу Пэ через лабораторию CEAR (Computational Emergent Alignment Research Lab). Проект разрабатывает вычислительную модель того, как искусственный агент может формировать стабильную внутреннюю перспективу, поддерживать когерентный аффект и становиться взаимно интерпретируемым с другими агентами, что предлагается в качестве дополнения к подходам выравнивания ИИ, основанным на внешне заданных целях и функциях вознаграждения.

Обзор

Основная гипотеза проекта заключается в том, что перспектива агента, его характерный способ интерпретации окружающей среды, может быть смоделирована как скрытая генеративная структура в его внутренних динамиках, а не путем настройки параметров или внешних заданных целей. На основе этой гипотезы дорожная карта охватывает три шестимесячных этапа: этап ориентации одного агента, за которым следует этапы эмоциональных и интегративных динамик, а затем этапы социального согласования нескольких агентов.

Фаза 1: Архитектура перспективы (Месяцы 1-6)

Фаза 1 реализует латентное ориентировочное многообразие, небольшой набор переменных, охватывающих предвзятость внимания, эмоциональную позицию, интерпретативный режим и стиль разрешения неоднозначности, которые формируют то, как агент воспринимает, делает выводы и действует, не кодируя явных целей или выгод. Результаты этой фазы представлены в preprint «Минимальные вычислительные предпосылки для субъективной перспективы в искусственных агентах» (arXiv:2602.02902), который был представлен на Симпозиуме по машинному сознанию AAAI 2026 Spring Symposium 8 апреля 2026 года.

Фаза 2: Эмоциональная согласованность и интегративная способность (месяцы 7–12)

Фаза 2 изучает, как эмоциональная согласованность и интеграционная способность – способность поддерживать внутреннюю организацию при одновременном удержании или разрешении частично несовместимых интерпретаций – возникают как динамические последствия архитектуры Фазы 1. Работа в рамках этой фазы направлена на предварительные публикации для конференции «Artificial Life» 2026 и «Simulation of Adaptive Behavior» 2026.

Фаза 3: Социальное резонансное влияние (месяцы 13–18)

Фаза 3 расширяет архитектуру до многоагентных сред, изучая, когда и как агенты становятся взаимопонятными без общей цели или явного канала связи. Относительная preprint «Моделирование эмпатии в агентах Active Inference для понимания перспектив и согласования» (arXiv:2602.20936), соавтор которой – Хонджу Пэй, Махольт Альбарацин, Анна Микеда, Алехандро Хименес Родригес, Санджив Намжоши, Далтон Сактивадхевел, Харшил Шах и Филип Вильсон, содержит информацию о работе по пониманию перспектив и моделированию эмпатии в агентах Active Inference.

Научный сотрудник

Хонджу Пэ (ORCID 0000-0002-5174-8858) присоединился к Институту в качестве Research Fellow в ноябре 2025 года и руководит проектом через CEAR Lab, Лабораторию вычислительных возникающих выравниваний. Работа Пэ интегрирует фреймворк Active Inference с феноменологическими подходами для выявления вычислимых маркеров перспективы и когерентности в искусственных системах.

Участвовать

Исследователи, заинтересованные в выравнивании ИИ, Active Inference и вычислительных моделях агентов и согласованности, приветствуются для отслеживания прогресса проекта и обращения через каналы сообщества Института.

Ключевые поверхности

Перспективные архитектуры для согласованного и гармоничного искусственного агента в общих чертах

18-месячный план дорожной карты

Три шестимесячных этапа, переходящих от одноагентской перспективы к многоагентной социальной согласованности.

Два препринта из arXiv

Результаты исследования субъективной перспективы и моделирования эмпатии в агентах Active Inference

AAAИ 2026 Весенний симпозиум

Результаты 1-го этапа представлены на Симпозиуме по машинному сознанию, 8 апреля 2026 г.

Связанные ресурсы

Публичные ссылки для этой страницы

Официальные страницы

Официальные поверхности Института