La interpretabilidad mecanicista (a veces abreviada como mech interp , mechinterp o MI ) es un subcampo de investigación dentro de la inteligencia artificial explicable que busca comprender el funcionamiento interno de las redes neuronales mediante el análisis de sus estructuras, algoritmos y circuitos concretos. Este enfoque pretende analizar las redes neuronales de forma similar a la ingeniería inversa del software convencional.
Historia
El término "interpretabilidad mecanicista" fue acuñado por Chris Olah para describir su trabajo en análisis de circuitos, en contraposición a los métodos habituales en IA interpretable. El análisis de circuitos intentaba caracterizar completamente las características y circuitos individuales dentro de los modelos, mientras que el campo más amplio tendía hacia enfoques basados en gradientes, como los mapas de prominencia . [ 1 ] [ 2 ]
Antes del análisis de circuitos, el trabajo en el subcampo combinaba varias técnicas como la visualización de características, la reducción de dimensionalidad y la atribución con métodos de interacción humano-computadora para analizar modelos como el modelo de visión Inception v1 . [ 3 ] [ 4 ]
Conceptos clave
La interpretabilidad mecanicista busca identificar estructuras, circuitos o algoritmos codificados en los pesos de los modelos de aprendizaje automático. [ 5 ] [ 6 ] Esto contrasta con los métodos de interpretabilidad anteriores que se centraban principalmente en explicaciones de " caja negra ". [ 7 ]
Hipótesis de representación lineal

Esta hipótesis sugiere que los conceptos de alto nivel se representan como direcciones lineales en el espacio de activación de las redes neuronales. La evidencia empírica de las incrustaciones de palabras y los grandes modelos de lenguaje respalda esta visión, aunque no es universal. [ 8 ] [ 9 ]
Métodos
La interpretabilidad mecanicista emplea métodos causales para comprender cómo los componentes internos del modelo influyen en los resultados, a menudo utilizando herramientas formales de la teoría de la causalidad. [ 10 ]
La interpretabilidad mecanicista, en el campo de la seguridad de la IA , se utiliza para comprender y verificar el comportamiento de sistemas de IA complejos y para intentar identificar riesgos potenciales [ 11 ] [ 6 ] como la desalineación de la IA.
Autoencoders dispersos
Un autoencoder disperso (SAE) es un modelo entrenado para desentrañar las activaciones de redes neuronales en representaciones dispersas. Las dimensiones aprendidas suelen representar conceptos simples y comprensibles para los humanos. Esta técnica fue aplicada a la interpretabilidad de modelos de lenguaje a gran escala por Anthropic . [ 12 ] [ 13 ] [ 14 ]
Características y circuitos
Un circuito en una red neuronal se compone de cadenas causales de activaciones de características. Al mapear qué circuitos conducen a qué consecuencias posteriores, así como al activar e inhibir circuitos, se puede analizar cómo una red neuronal (como un LLM) llega a un resultado determinado a partir de una entrada dada. [ 15 ]
Referencias
- ↑ Saphra, Naomi; Wiegreffe, Sarah (2024). ¿ Mecanicista? (PDF) . Taller BlackboxNLP.
- ↑ Olah, Chris ; Cammarata, Nick; Schubert, Ludwig; Goh, Gabriel; Petrov, Michael; Carter, Shan (10 de marzo de 2020). "Zoom In: Una introducción a los circuitos" . Distill . 5 (3) e00024.001. doi : 10.23915/distill.00024.001 . ISSN 2476-0757 .
- ↑ Olah, Chris ; Satyanarayan, Arvind; Johnson, Ian; Carter, Shan; Schubert, Ludwig; Ye, Katherine; Mordvintsev, Alexander (6 de marzo de 2018). "Los bloques de construcción de la interpretabilidad" . Distill . 3 (3) e10. doi : 10.23915/distill.00010 . ISSN 2476-0757 .
- ↑ Olah, Chris ; Cammarata, Nick; Schubert, Ludwig; Goh, Gabriel; Petrov, Michael; Carter, Shan (1 de abril de 2020). "Una visión general de la visión temprana en InceptionV1" . Distill . 5 (4) e00024.002. doi : 10.23915/distill.00024.002 . ISSN 2476-0757 .
- ↑ Conmy, Arthur; Mavor-Parker, Augustine N.; Lynch, Aengus; Heimersheim, Stefan; Garriga-Alonso, Adrià (10 de diciembre de 2023). "Hacia el descubrimiento automatizado de circuitos para la interpretabilidad mecanicista" . Actas de la 37.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . Art. 719. Red Hook , Nueva York: Curran Associates Inc. pp. 16318–16352 .
- 1 2 Levy, Steven (27 de octubre de 2025). "Por qué la IA se vuelve mala" . Wired . ISSN 1059-1028 . Recuperado el 18 de marzo de 2026 .
- ↑ Kästner, Lena; Crook, Barnaby (11 de octubre de 2024). "Explicando la IA a través de la interpretabilidad mecanicista". European Journal for Philosophy of Science . 14 (4) 52. doi : 10.1007/s13194-024-00614-4 . ISSN 1879-4920 .
- ↑ Mikolov, Tomas ; Yih, Wen-tau; Zweig, Geoffrey (junio de 2013). "Regularidades lingüísticas en representaciones de palabras en espacio continuo" . En Vanderwende, Lucy; Daumé III, Hal; Kirchhoff, Katrin (eds.). Actas de la Conferencia de 2013 del Capítulo Norteamericano de la Asociación de Lingüística Computacional : Tecnologías del lenguaje humano . Atlanta , Georgia: Asociación de Lingüística Computacional . págs. 746–751 .
- ↑ Park, Kiho; Choe, Yo Joong; Veitch, Victor (21 de julio de 2024). "La hipótesis de la representación lineal y la geometría de los grandes modelos de lenguaje" . Actas de la 41.ª Conferencia Internacional sobre Aprendizaje Automático . Actas de Investigación en Aprendizaje Automático. Vol. 235, art. 1605. Viena , Austria. pp. 39643–39666 .
- ↑ Vig, Jesse; Gehrmann, Sebastian; Belinkov, Yonatan; Qian, Sharon; Nevo, Daniel; Singer, Yaron; Shieber, Stuart (6 de diciembre de 2020). «Investigación del sesgo de género en modelos lingüísticos mediante análisis de mediación causal» . Actas de la 34.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . Art. 1039. Red Hook , Nueva York: Curran Associates Inc. pp. 12388–12401 . ISBN 978-1-7138-2954-6.
- ↑ Sullivan, Mark (22 de abril de 2025). "Esta startup quiere reprogramar la mente de la IA y acaba de conseguir 50 millones de dólares para hacerlo" . Fast Company . Consultado el 12 de mayo de 2025 .
- ↑ "Los investigadores están descifrando cómo funcionan los modelos de lenguaje a gran escala" . The Economist . 11 de julio de 2024. ISSN 0013-0613 . Consultado el 18 de marzo de 2026 .
- ↑ Geiger, Atticus; Ibeling, Duligur; Zur, Amir; Chaudhary, Maheep; Chauhan, Sonakshi; Huang, Jing; Arora, Aryaman; Wu, Zhengxuan; Goodman, Noah; Potts, Christopher ; Icard, Thomas (2025). "Abstracción causal: una base teórica para la interpretabilidad mecanicista" . Journal of Machine Learning Research . 26 (83): 1– 64. ISSN 1533-7928 .
- ^ Somvanshi, Shriyank; Islam, Md. Monzurul; Rafe, Amir; Tusti, Anannya Ghosh; Chakraborty, Arka; Baitullah, Anika; Chowdhury, Tausif Islam; Alnawmasi, Nawaf; Dutta, Anandi; Das, Subasish (junio de 2026). "Uniendo la caja negra: una encuesta sobre la interpretabilidad mecanicista en la IA". Encuestas de Computación ACM . 58 (8) 210.doi : 10.1145 /3787104 . ISSN 0360-0300 .
- ↑ Lindsey, Jack; Gurnee, Wes; Ameisen, Emmanuel; et al. (27 de marzo de 2025). "Sobre la biología de un modelo de lenguaje grande" . Hilo de Transformer Circuits . Anthropic.
Lecturas adicionales
- Nanda, Neel (2023). "Representaciones lineales emergentes en modelos de mundo de modelos de secuencia auto-supervisados" . Taller BlackNLP : 16–30 . doi : 10.18653/v1/2023.blackboxnlp-1.2 .
- Aprendizaje automático
- Inteligencia artificial