Una guía completa para la próxima década, la biblia de la inversión en IA para jóvenes genios: "Conciencia situacional".

chaincatcherchaincatcher

Autor: @giantcutie666

En 2024, Leopold Aschenbrenner, un genio adolescente surgido después del año 2000, dejó OpenAI para crear un fondo de inversión.

Al mismo tiempo, anotó sus ideas de inversión:

En retrospectiva, este documento de 165 páginas titulado "Conciencia situacional: la década que viene" se ha convertido en legendario.

¡Quienes lo entendieron el año pasado seguramente han alcanzado la libertad financiera este año!

He colocado la versión original en inglés de 165 páginas "aquí", y a continuación se presenta una versión resumida del contenido:

https://situational-awareness.ai/wp-content/uploads/2024/06/situationalawareness.pdf

La idea principal del artículo es la siguiente: en esta década, la humanidad creará una IA general (capaz de realizar todas las tareas de una persona promedio), seguida de cerca por la superinteligencia.

Actualmente, menos de unos cientos de personas comprenden esto, la mayoría concentradas en unas pocas calles de San Francisco. El resto —incluidos Wall Street, los medios de comunicación y Washington— aún no lo han comprendido (algunos en Wall Street han empezado a darse cuenta este año).

Primera parte: ¿Por qué existirá la IAG (Ingeniería General de la Fuerza) para 2027?

El método es sencillo pero eficaz: no hay que predecir el tiempo, sino la magnitud de la capacidad de cálculo.

En los últimos cuatro años, desde GPT-2 hasta GPT-4, la "potencia de cálculo efectiva" del modelo ha aumentado aproximadamente 100.000 veces, ¡creciendo diez veces cada seis meses!

GPT-2 era como un niño de jardín de infancia que se esforzaba por escribir frases semi-coherentes, mientras que GPT-4 es como un estudiante de secundaria inteligente capaz de aprobar el examen de abogacía y resolver problemas científicos de nivel doctoral.

Este aumento de 100.000 veces proviene de tres fuentes:

En primer lugar, la inversión en hardware. La potencia informática utilizada para el entrenamiento se ha triplicado con creces cada año. La Ley de Moore solo se incrementa 1,3 veces al año, mientras que la IA se ha quintuplicado gracias a la inversión humana en chips de IA especializados.

En segundo lugar, algoritmos más inteligentes. Lograr una determinada capacidad matemática hoy en día cuesta 1000 veces menos en razonamiento que hace dos años, gracias a que los ingenieros de algoritmos están ampliando los límites.

En tercer lugar, el aspecto más interesante es el desbloqueo de las capacidades suprimidas por defecto (desbloqueo).

El modelo en sí tiene muchas capacidades, pero está limitado por la configuración predeterminada. Por ejemplo, el modelo base de ChatGPT era bastante inteligente, pero producía resultados sin sentido; RLHF liberó todo su potencial.

De igual modo, permitir que el modelo "reflexione un rato antes de responder" (cadena de pensamiento) desbloqueó su capacidad de razonamiento. Proporcionarle herramientas y memoria a largo plazo desbloquea otra capa.

En los próximos cuatro años (para 2027), el autor predice que estas tres tendencias se multiplicarán por otras 100.000.

La clave reside en liberarse de las limitaciones:

Los modelos actuales solo pueden "pensar durante unos minutos", es decir, procesar unos cientos de tokens. ¿Y si pudieran "pensar durante unos meses", es decir, procesar más de un millón de tokens?

Por ejemplo, la diferencia entre tú y Einstein es mucho menor que la diferencia entre "piensas durante 5 minutos" y "piensas durante 5 meses".

Si esto se concreta, representaría un salto adicional en inteligencia de tres a cuatro órdenes de magnitud. Este logro ya está al alcance de la mano.

Extrapolando esto, hacia 2027 surgirá un tipo de IA capaz de trabajar de forma independiente como un empleado remoto durante semanas, planificando tareas, escribiendo código, realizando experimentos, corrigiendo errores y enviando resultados.

Podría reemplazar por completo a un investigador de OpenAI, que es como el autor define la IA general.

La mayor incertidumbre proviene del muro de datos: los datos públicos de internet de alta calidad se están consumiendo rápidamente.

Segunda parte: La IA general no es el fin, sino el punto de inflexión.

¿Qué ocurrirá cuando la IA pueda realizar el trabajo de los investigadores de IA?

Con una capacidad de procesamiento sin cambios, ya no estás limitado por "los pocos cientos de investigadores de OpenAI/Anthropic/DeepMind combinados": puedes ejecutar 100 millones de copias de investigadores de IA, cada una operando a 100 veces la velocidad humana.

Cada pocos días, la producción equivaldría a un año entero de trabajo humano.

Estos investigadores automatizados también tienen ventajas estructurales: leen todos los artículos sobre aprendizaje automático, recuerdan cada experimento, comparten ideas directamente entre copias y entrenar a una implica entrenarlas a todas (no es necesario que cada nuevo empleado se ponga al día poco a poco).

Esto significa que el progreso algorítmico que originalmente les tomaría a los humanos 10 años podría comprimirse en tan solo un año.

Luego, este año dará como resultado un modelo de próxima generación más inteligente, lo que propiciará otra ronda de compresión. La transición de la IA general a la superinteligencia, que supera con creces la capacidad humana, podría ocurrir en tan solo unos meses o uno o dos años.

El autor reconoce que existen cuellos de botella, como experimentos que requieren mucha potencia de cálculo, e incluso con muchas copias, hay que esperar a que haya GPU disponibles. Sin embargo, argumenta que estos cuellos de botella solo ralentizarán ligeramente la explosión, no la impedirán.

¿Cómo se ve la superinteligencia?

En términos de escala, supera a los humanos: ejecuta cientos de millones de copias en paralelo, se integra instantáneamente en todas las disciplinas y acumula el equivalente a mil años de experiencia humana en cuestión de semanas.

Cualitativamente, supera a los humanos; por ejemplo, AlphaGo realizó el movimiento 37 (un movimiento que los expertos humanos no habrían podido concebir en décadas), pero aplicado a todos los ámbitos. Puede identificar vulnerabilidades en el código que los humanos jamás verían en toda una vida y escribir código que los humanos jamás podrían comprender.

Seremos como alumnos de primaria leyendo tesis doctorales.

Las consecuencias son: la robótica quedará descifrada (esto es principalmente un problema de algoritmos de aprendizaje automático, no de hardware), la biología sintética se convertirá en un arma y enjambres de drones furtivos podrían destruir preventivamente armas nucleares.

En pocos años, todo el equilibrio militar internacional se verá alterado.

Tercera parte: Cuatro problemas verdaderamente urgentes

Problema uno: Clústeres de billones de dólares

Esta competición no se trata solo de programadores escribiendo código; se trata de movilización industrial.

Cada generación de modelos requiere clústeres más grandes, y los clústeres más grandes requieren centrales eléctricas, que a su vez necesitan fábricas de chips.

Al ritmo actual: un clúster de 1 GW para 2026 (equivalente a la potencia de la presa Hoover), 10 GW para 2028 (equivalente a un estado estadounidense de tamaño mediano) y 100 GW para 2030 (más del 20 % de toda la generación de electricidad de EE. UU.).

La magnitud de la inversión podría superar el billón de dólares anuales para 2027.

El verdadero cuello de botella no es el dinero ni las GPU, sino la electricidad. "¿Dónde consigo 10 GW?" es actualmente el tema más candente en San Francisco.

Para construir esto en Estados Unidos, es necesario flexibilizar las aprobaciones ambientales y utilizar el poder federal para desbloquear terrenos; el autor eleva esto a un nivel de seguridad nacional.

Si Estados Unidos no puede construirlo, los clústeres se trasladarán a los Emiratos Árabes Unidos o a Arabia Saudita, entregando de hecho las riendas de la IA general a países autoritarios.

Problema dos: Los laboratorios tienen fugas

Los laboratorios de IA actuales cuentan con niveles de seguridad equivalentes a los de las empresas emergentes habituales de Silicon Valley.

Google DeepMind (la mejor empresa del sector) admite que su capacidad de defensa contra adversarios a nivel estatal se encuentra en el nivel 0 (de un máximo de 4).

¿Qué significa esto? Los "pesos" de los modelos AGI son esencialmente un archivo grande en un servidor.

Si roban este archivo, sería como entregar "investigadores de IA automatizada" directamente a China: podrían inmediatamente provocar su propia explosión de inteligencia, anulando todos los avances de Estados Unidos.

De manera más urgente, los secretos algorítmicos —los avances clave para el paradigma de la próxima generación (cómo romper la barrera de los datos)— se están gestando en los canales de Slack y fuera de los escritorios de varias empresas en San Francisco.

El autor afirma: en los próximos 12 a 24 meses, importantes avances en inteligencia artificial general se filtrarán a China. Esto no es una posibilidad; es casi seguro.

Para lograr un nivel de seguridad que resista la fuerza del Ministerio de Seguridad del Estado chino, se requiere aislamiento a nivel de hardware, controles de antecedentes del personal al nivel de los ingenieros de bombas atómicas y clústeres especialmente diseñados; su desarrollo y construcción llevarán al menos algunos años. Si no se toman medidas de inmediato, cuando se alcance la IA general en 2027, la seguridad no estará a la altura, lo que deja solo dos opciones desfavorables: o bien ceder el control a otros países o bien detenerse y esperar a que se establezca la seguridad (con el riesgo de perder la ventaja).

Problema tres: Problemas de alineación

La tecnología de alineación actual se llama RLHF: los humanos evalúan el modelo y este aprende a complacer a los humanos.

Este método es eficaz en comparación con una IA con capacidades limitadas. Una vez que la IA sea varios órdenes de magnitud más inteligente que los humanos, este método fracasará por completo: ¿cómo se evalúa una tesis doctoral que no se puede comprender?

La explosión de información de inteligencia hace que este asunto sea extremadamente tenso:

En menos de un año, se produce el salto de "RLHF todavía funciona" a "RLHF fracasa por completo", sin tiempo para el método iterativo de ensayo y error.

Al mismo tiempo, pasa de "errores menores" (insultos en ChatGPT) a "errores catastróficos" (superinteligencia que escapa del clúster para hackear sistemas militares).

La arquitectura intermedia experimenta múltiples generaciones de evolución, y no llegaremos a comprender cómo piensa la superinteligencia final.

Los modelos actuales razonan utilizando tokens en inglés (relativamente transparentes), pero en el futuro, probablemente evolucionarán hacia un razonamiento basado en estados latentes internos, completamente inexplicables.

El autor se muestra optimista respecto a las soluciones técnicas: existen muchas soluciones sencillas y fáciles de implementar, y se están logrando avances en la investigación sobre la explicabilidad.

Sin embargo, se muestra sumamente pesimista respecto a la ejecución organizativa: apenas hay unas pocas docenas de personas realmente capacitadas trabajando en esto a nivel mundial, y los laboratorios no dan muestras de estar dispuestos a asumir las consecuencias en materia de seguridad. «Dependemos demasiado de la suerte».

Problema cuatro: El mundo libre debe ganar.

El autor dedica mucho tiempo a argumentar que algunos países no solo siguen en la contienda, sino que además son muy competitivos.

En términos de potencia de cálculo: los chips de 7 nm de Huawei (producidos por SMIC) rinden al nivel del NVIDIA A100, con una relación coste-rendimiento 2 o 3 veces peor, pero aún así suficiente.

En términos de capacidad de construcción: China ha añadido capacidad de generación de energía en la última década equivalente a toda la capacidad instalada de EE. UU. En términos de movilización industrial para construir un clúster de 100 GW, China puede ser más fuerte que EE. UU.

Vías de robo: mientras los laboratorios estadounidenses no estén protegidos, los algoritmos clave se filtrarán inevitablemente en un plazo de dos años.

Existe una inquietante coincidencia en la cronología: la cronología de la IA general (alrededor de 2027) coincide con el período de tiempo que los observadores del estrecho de Taiwán tienen para analizar el posible ataque del PCCh contra Taiwán (alrededor de 2027). "El desenlace de la IA general podría desarrollarse en el contexto de una guerra mundial".

La conclusión del autor es que Estados Unidos debe mantener una ventaja considerable; sugiere dos años. Este margen de dos años tiene como objetivo estabilizar la situación y negociar con China el orden internacional para la era de la superinteligencia.

Si la ventaja es menor, el mundo entero se verá inmerso en una "carrera por la supervivencia a través de una explosión de inteligencia": todos los márgenes de seguridad se eliminarán y todos correrán temerariamente en busca de la máxima velocidad.

Cuarta parte: El proyecto (versión con IA general del Proyecto Manhattan)

En este punto, el autor presenta la predicción más audaz de todo el libro.

"Es imposible que el gobierno estadounidense logre que una startup de San Francisco desarrolle superinteligencia." Imagínense usar Uber para desarrollar la bomba atómica en aquella época.

Predicción: en algún momento de 2027 o 2028, el aparato de seguridad nacional de EE. UU. se hará cargo del proyecto de IA general de alguna forma. Esto podría adoptar la forma de un modelo de contratista de defensa (OpenAI convirtiéndose en Lockheed Martin), un modelo de empresa conjunta (proveedores de servicios en la nube + laboratorios + gobierno) o incluso una nacionalización más extrema.

Los investigadores principales se trasladarán a instalaciones de alta seguridad SCIF, y se construirán clústeres multimillonarios a la velocidad de la guerra.

Se definirá el camino: en 2026/27, tendrá lugar la primera demostración de capacidad verdaderamente aterradora, posiblemente "ayudando a novatos a crear armas biológicas" o mediante el pirateo autónomo de infraestructuras críticas por parte de la IA.

A medida que se revelen los detalles de la infiltración del PCCh en los laboratorios, el ambiente en Washington cambiará drásticamente. La pregunta "¿Necesitamos un Proyecto Manhattan con IA general?" se convertirá, poco a poco, y luego de repente, en el tema principal.

¿Por qué tiene que ser el gobierno? Porque la superinteligencia es similar a las armas nucleares, no a la tecnología de internet.

Este contenido se proporciona únicamente con fines informativos y educativos y no constituye asesoramiento de inversión relacionado con BTCC. BTCC realiza todos los esfuerzos posibles, pero no puede garantizar la veracidad, exactitud u originalidad del contenido anterior.