Arquitecturas de Perspectiva para una Agencia Artificial Coherente y Sintonizada es un proyecto de investigación del Instituto de 18 meses dirigido por Research Fellow Hongju Pae a través de CEAR Lab (Computational Emergent Alignment Research Lab). El proyecto desarrolla una explicación computacional de cómo un agente artificial podría formar una perspectiva interna estable, mantener un afecto coherente y volverse mutuamente interpretable con otros agentes, propuesto como un complemento a los enfoques de alineación de IA basados en objetivos y funciones de recompensa especificadas externamente.
Descripción general
La hipótesis central del proyecto es que la perspectiva de un agente, su forma característica de interpretar su entorno, puede modelarse como una estructura generativa latente dentro de su dinámica interna, en lugar de ajustarse mediante el ajuste de parámetros o objetivos especificados externamente. Partiendo de esta hipótesis, el plan de trabajo abarca tres fases de seis meses: una capa de orientación de un solo agente, seguida por la dinámica afectiva e integradora, seguida por la afinación social multiagente.
Fase 1: Arquitectura de Perspectiva (Meses 1-6)
Fase 1 implementa un manojo latente de orientación, un conjunto pequeño de variables que abarcan el sesgo atencional, la postura afectiva, el modo interpretativo y el estilo de resolución de ambigüedades, que da forma a cómo un agente percibe, infiere y actúa sin codificar objetivos o utilidades explícitos. Los hallazgos de esta fase se informan en el preprint 'Minimal Computational Preconditions for Subjective Perspective in Artificial Agents' (arXiv:2602.02902), que fue presentado y discutido en el Simposio de Primavera sobre Conciencia Máquina de AAAI 2026 el 8 de abril de 2026.
Fase 2: Coherencia afectiva y capacidad integradora (meses 7-12)
Fase 2 examina cómo la coherencia afectiva y la capacidad integradora, la habilidad para mantener una organización interna mientras se sostiene o negocia entre interpretaciones parcialmente incompatibles, surgen como consecuencias dinámicas de la arquitectura de la Fase 1. El trabajo de esta fase está dirigido a preimpresos para la Conferencia Artificial Life 2026 y Simulación de Comportamiento Adaptativo 2026.
Fase 3: Resonancia Social (Meses 13-18)
Fase 3 extiende la arquitectura a entornos de múltiples agentes, estudiando cuándo y cómo los agentes se vuelven mutuamente interpretables sin un objetivo compartido o un canal de comunicación explícito. Un preprint relacionado, 'Modelado de Empatía en Agentes de Inferencia Activa para la Toma de Perspectivas y Alineación' (arXiv:2602.20936), co-autorado por Hongju Pae con Mahault Albarracin, Anna Mikeda, Alejandro Jimenez Rodriguez, Sanjeev Namjoshi, Dalton Sakthivadivel, Harshil Shah y Philip Wilson, informa sobre trabajos relacionados con la toma de perspectiva y el modelado de empatía en agentes de Inferencia Activa.
Investigador/a asociado/a
Hongju Pae (ORCID 0000-0002-5174-8858) se unió al Instituto como Research Fellow en noviembre de 2025 y lidera el proyecto a través de CEAR Lab, el Laboratorio de Investigación de Alineación Emergente Computacional. El trabajo de Pae integra el marco Active Inference con enfoques fenomenológicos para identificar marcadores computables de perspectiva y coherencia en sistemas artificiales.
Participar
Investigadores interesados en la alineación de la IA, Active Inference y modelos computacionales de agencia y coherencia son bienvenidos a seguir el progreso del proyecto y ponerse en contacto a través de los canales comunitarios del Instituto.