Arquitecturas de Perspectiva para Agencias Artificiales Coherentes y Ajustadas es un proyecto de investigación del Instituto de 18 meses liderado por el Investigador Asociado Hongju Pae a través del Laboratorio CEAR (Laboratorio de Investigación de Alineación Emergente Computacional). El proyecto desarrolla una cuenta computacional de cómo un agente artificial podría formar una perspectiva interna estable, mantener una afectación coherente y volverse mutuamente interpretable con otros agentes, propuesta como complemento a los enfoques de alineamiento de IA construidos sobre objetivos y funciones de recompensa especificados externamente.
Descripción general
La hipótesis central del proyecto es que la perspectiva de un agente, su forma característica de interpretar su entorno, puede ser modelada como una estructura generativa latente dentro de su dinámica interna, en lugar de ajustarse mediante el ajuste de parámetros o objetivos especificados externamente. Partiendo de esta hipótesis, el plan maestro abarca tres fases de seis meses: una capa de orientación para un solo agente, seguida por la dinámica afectiva e integradora, y finalmente, la afinación social multiagente. El plan de investigación completo del proyecto y la documentación técnica están alojados a través de CEAR Lab (hjpae.github.io/cear/).
Fase 1: Arquitectura de Perspectiva (Meses 1-6)
Fase 1 implementa un manojo latente de orientación, un conjunto pequeño de variables que abarcan el sesgo atencional, la postura afectiva, el modo interpretativo y el estilo de resolución de ambigüedades, que da forma a cómo un agente percibe, infiere y actúa sin codificar objetivos o utilidades explícitos. Los hallazgos de esta fase se informan en el preprint 'Minimal Computational Preconditions for Subjective Perspective in Artificial Agents' (arXiv:2602.02902), que fue presentado y discutido en el Simposio de Primavera sobre Conciencia Máquina de AAAI 2026 el 8 de abril de 2026.
Fase 2: Coherencia afectiva y capacidad integradora (meses 7-12)
Fase 2 examina cómo la coherencia afectiva y la capacidad integradora, la habilidad para mantener una organización interna mientras se sostiene o negocia entre interpretaciones parcialmente incompatibles, surgen como consecuencias dinámicas de la arquitectura de la Fase 1. El trabajo de esta fase está dirigido a preimpresos para la Conferencia Artificial Life 2026 y Simulación de Comportamiento Adaptativo 2026.
Fase 3: Resonancia Social (Meses 13-18)
Fase 3 extiende la arquitectura a entornos de múltiples agentes, estudiando cuándo y cómo los agentes se vuelven mutuamente interpretables sin un objetivo compartido o un canal de comunicación explícito. Un preprint relacionado, 'Modelado de Empatía en Agentes de Inferencia Activa para la Toma de Perspectivas y Alineación' (arXiv:2602.20936), co-autorado por Hongju Pae con Mahault Albarracin, Anna Mikeda, Alejandro Jimenez Rodriguez, Sanjeev Namjoshi, Dalton Sakthivadivel, Harshil Shah y Philip Wilson, informa sobre trabajos relacionados con la toma de perspectiva y el modelado de empatía en agentes de Inferencia Activa.
Investigador/a asociado/a
Hongju Pae (ORCID 0000-0002-5174-8858) se unió al Institute como Investigador Asociado en noviembre de 2025 y lidera el proyecto a través del CEAR Lab, el Laboratorio de Investigación Computacional de Alineación Emergente. El trabajo de Pae integra el marco de Active Inference con enfoques fenomenológicos para identificar marcadores computables de perspectiva y coherencia en sistemas artificiales.
Participar
Investigadores interesados en la alineación de la IA, Active Inference y modelos computacionales de agencia y coherencia son bienvenidos a seguir el progreso del proyecto y ponerse en contacto a través de los canales comunitarios del Instituto.