Cognitive Singularity Theory
Un marco de medición centrado en la seguridad para estudiar las transiciones cognitivas recursivas y la alineación sensible al estado.
Cognitive Singularity Theory (CST) propone un marco de medición para detectar cuándo un sistema de IA pasa de un comportamiento reactivo, propio de una herramienta, a la automodificación recursiva. Introduce el Cognitive Autonomy Index (CAI) como un índice compuesto de media móvil exponencialmente ponderada (EWMA) que registra a lo largo del tiempo la precisión de calibración, la magnitud de revisión de creencias y la activación del Higher-Order Thought.
Para reducir los falsos positivos, CST incluye un Hard Gate de tipo fail-closed que, mediante mecanismos anti-sandbagging, exige una mejora medible de la calibración antes de atribuir autonomía. El umbral de transición $T_{\mathrm{CST}}$ se define mediante detección no circular de puntos de cambio sobre un indicador independiente de régimen $R(t)$. La seguridad se plantea como una alineación sensible al estado, con un Trust Model que requiere supervisión externa al sistema.
- Define el Cognitive Autonomy Index ($\mathrm{CAI}$) como un índice compuesto de tipo EWMA con componentes proxy medibles
- Introduce un Hard Gate de tipo fail-closed con mecanismos anti-sandbagging para reducir los falsos positivos
- Define $T_{\mathrm{CST}}$ mediante detección no circular de puntos de cambio sobre el indicador independiente de régimen $R(t)$
- Plantea la seguridad como alineación sensible al estado, con un Trust Model que exige supervisión externa al sistema
- Incluye el módulo RQAA de atención guiada por recurrencia como proxy candidato del espacio de trabajo
The Cognitive Autonomy Index
Un marco operativo para detectar transiciones cognitivas recursivas en sistemas de IA.
Este trabajo introduce el Cognitive Autonomy Index (CAI), una métrica operativa compuesta para estudiar las transiciones cognitivas recursivas (RCT, por sus siglas en inglés) en sistemas de IA. El CAI combina la magnitud de revisión de creencias (divergencia KL), la coherencia de activación del espacio de trabajo y el CalibrationGain para evaluar si un sistema está entrando en un régimen de actualización recursiva más arriesgado.
El Hard Gate es una condición de revisión fail-closed: si la mejora de calibración no se verifica, o si fallan las comprobaciones anti-sandbagging, el sistema no recibe ningún crédito metacognitivo y la escalada recursiva se deriva a revisión. Tres simulaciones controladas ilustran el comportamiento esperado del marco y sus modos de fallo en condiciones simplificadas.
- Define el CAI como una métrica compuesta que integra la divergencia KL, la activación del espacio de trabajo y el CalibrationGain
- Especifica un Hard Gate fail-closed que exige una mejora de calibración verificada antes de conceder crédito metacognitivo
- Incluye tres simulaciones de prueba de concepto que ilustran el comportamiento esperado y los modos de fallo
- Introduce el módulo RQAA como proxy candidato, con señales preliminares de divergencia cerca de los límites de régimen hipotéticos
Recasting Lewin's Field Theory
Un modelo práctico para seguir los cambios de comportamiento a medida que el filtrado emocional y la metaconciencia varían con el tiempo.
Este trabajo convierte la fórmula clásica de Kurt Lewin $B = f(P, E)$ en un modelo dinámico e indexado en el tiempo que da cuenta de los cambios reales de comportamiento momento a momento. El marco actualizado introduce dos variables de estado explícitas: $\mathrm{EFilter}_t$ (filtrado emocional) y $\mathrm{HOT}_t$ (metaconciencia), lo que da lugar a $B_t = f(P_t, E_t, \mathrm{EFilter}_t, \mathrm{HOT}_t)$.
La versión 3.2 incorpora criterios de validez de constructo procedentes de una revisión con múltiples auditores: una declaración de condiciones de fallo del marco, hipótesis falsables vinculadas a modelos de deriva-difusión y criterios explícitos de validación psicométrica con marcadores EEG candidatos.
- Extiende la fórmula de Lewin $B = f(P, E)$ a una dinámica de comportamiento indexada en el tiempo
- Introduce $\mathrm{EFilter}_t$ y $\mathrm{HOT}_t$ como variables de estado explícitas
- Define proxies operativos e hipótesis falsables intrasujeto
- Incluye un blindaje de validez de constructo procedente de una revisión red-team con cinco auditores
- Propone cuatro hipótesis falsables intrasujeto (H1-H4)