Zuckerberg habla sobre Muse: la explosión de los agentes de IA y la convergencia de las tres grandes apuestas de Meta

Agente de IAMetaAGI
hace 1 horaFuente: blockweeks.com
Zuckerberg habla sobre Muse: la explosión de los agentes de IA y la convergencia de las tres grandes apuestas de Meta

Autor: Long Yue, Wallstreetcn

Hace tres años, el CEO de Meta, Zuckerberg, dijo en el programa de Joe Rogan que algún día, cuando las personas se pusieran gafas, un Agente de IA aparecería con ellas. Ahora, esta escena puede estar sucediendo.

El Agente de IA personal de Meta, Muse, alcanzó millones de usuarios en dos semanas desde su lanzamiento. Zuckerberg dijo en un programa de entrevistas el 25 de septiembre: "Cada pocos años obtenemos algo como esto". Caracterizó la acogida temprana de Muse como "un jonrón desde el primer momento", lo cual es raro en la historia de productos de Meta.

Al mismo tiempo, anunció que Muse se integrará en toda la línea de gafas inteligentes Ray-Ban, y los usuarios ya no necesitarán decir "Hey Meta", sino que podrán personalizar una palabra de activación para llamar directamente a su propio Agente de IA personal.

Durante años, el metaverso, las gafas inteligentes y los grandes modelos, que el mundo exterior veía como tres apuestas independientes, están acelerando su convergencia a nivel de producto interno en Meta.

En esta entrevista, Zuckerberg también admitió que el fracaso de Llama 4 fue el "momento más aterrador", y reveló que Meta está construyendo un clúster de entrenamiento de 5 gigavatios, creyendo que una potencia de cómputo suficientemente grande puede "forzar por la fuerza bruta" la AGI.

Zuckerberg habla sobre Muse: el Agente de IA explota, 'metaverso, gafas inteligentes y grandes modelos' las tres grandes apuestas completan su convergencia

Por qué Muse puede ser "un jonrón desde el primer momento"

El punto de partida de Muse fue Zuckerberg sentándose con los miembros del equipo Nat y Alex, usando herramientas de código abierto para "armar" una versión temprana en casa.

"Nos dimos cuenta de que esta era una experiencia mágica", dijo Zuckerberg, "si pudiéramos convertirlo en algo que cualquiera pueda usar, sin tener que comprar una Mac Mini, sin tener que trastear en la terminal, entonces esto sería algo que miles de millones de personas querrían usar".

Este juicio impulsó toda la lógica de I+D posterior: no solo entrenar modelos, sino el autodesarrollo de pila completa desde el modelo, el andamiaje, hasta el mecanismo de "latido" del Agente; el Agente se despertará automáticamente periódicamente, verificará los objetivos del usuario y avanzará proactivamente en las tareas pendientes.

Los datos posteriores al lanzamiento confirmaron este juicio. Dos semanas, millones de usuarios.

IA personal: el enfoque está en la ejecución, la memoria y el "juicio"

En cuanto a la diferencia entre la IA personal y la IA general, Zuckerberg resumió el enfoque actual de la competencia como hacer que los modelos sean mejores Agentes.

"Lo más importante del último año es básicamente los Agentes de codificación". Dijo que la capacidad de codificación es importante porque incluso si los usuarios no están escribiendo código directamente, "tu Muse también estará escribiendo código para ti en segundo plano todo el tiempo, para lograr diversas cosas".

Pero cree que un Agente personal no puede tener solo capacidades de codificación o ejecución de tareas; también necesita comprender los límites de privacidad y el contexto social.

Zuckerberg dio un ejemplo: cuando un usuario le pide a Muse que reserve un restaurante, el Agente puede conocer información como las alergias o el embarazo del usuario, pero eso no significa que esta información deba divulgarse automáticamente. "Quieres que complete la tarea divulgando la menor cantidad de información posible".

Dijo que esta capacidad pertenece a las "habilidades sociales básicas o sentido común" que los humanos suelen poseer, pero si las empresas solo están entrenando Agentes de codificación, muchas de ellas no lo han incorporado al alcance de las capacidades del modelo.

"Entrenamos todo el modelo, en lugar de tomar el modelo ya hecho de otra persona y construir un marco y un Agente a su alrededor", dijo Zuckerberg.Meta también ha añadido características a nivel de producto como memoria, seguimiento de tareas, animación de personajes virtuales e interacción de voz en tiempo real.

Sobre la personalización, dijo que Meta no cree que la IA deba tener una sola personalidad fija. "Muchos laboratorios se centran en cómo ajustar la personalidad al estado correcto, pero nunca he creído que haya una sola respuesta correcta para la personalidad".

Dijo que Muse permite a los usuarios modificar el avatar, la voz y la personalidad básica, y el modelo está diseñado para ser altamente controlable. "Puedes definir cómo quieres interactuar con él, lo cual es muy importante para un Agente personal".

Cada Agente tiene su propia "computadora"

Una de las diferencias centrales de infraestructura entre Muse y otros productos de IA es que Meta equipa a cada Agente con su propia VM segura.

Zuckerberg explicó por qué esto es necesario:

Tu Agente sabrá mucha información sensible sobre ti. No creemos que esta información deba mezclarse en un mismo grupo con los datos de todos los demás.

Comparó la Muse Secure VM con "esa computadora debajo de tu escritorio que te pertenece solo a ti": los datos del usuario se almacenan cifrados, y las credenciales sensibles, como las contraseñas, se gestionan mediante un módulo de seguridad independiente que el propio Agente no puede leer directamente.

Sobre esta base, Meta también ha diseñado un Agente de seguridad "Sentinel" específicamente para monitorear los flujos de datos que entran y salen de Muse. Una vez que se detectan anomalías u operaciones de alto riesgo, las interceptará directamente y solicitará autorización al usuario.

El metaverso, las gafas inteligentes y los Agentes: tres caminos están convergiendo

En la entrevista, Zuckerberg reveló que Muse se integrará completamente en la serie de gafas inteligentes Ray-Ban y actualizará el método de interacción existente.

Las gafas actuales ofrecen una experiencia de "conversación de un solo turno": dices una cosa, recibes una respuesta y termina. Después de integrar Muse, las gafas se convierten en el punto de entrada frontal del Agente: el usuario habla, y el Muse del back-end sigue trabajando en la Secure VM, y luego informa una vez que la tarea está completa.

En cuanto a la hoja de ruta del producto para las gafas, describió una clara escalera de hardware:

  • Gafas solo de audio sin cámara: ya equipadas con Muse, pueden gestionar llamadas, música y tareas de voz
  • Meta Ray-Ban con una pequeña pantalla: ya lanzadas, con retroalimentación visual básica
  • Prototipo de AR holográfico de campo de visión completo: ya lanzado, que Zuckerberg calificó de "muy emocionante"

Dijo que la inversión a largo plazo de Meta en gafas sitúa a la empresa en una posición relativamente favorable una vez que los Agentes de IA maduren.Meta está llevando Muse y más funciones de IA a sus productos de gafas, mientras que la tecnología del metaverso, que antes enfatizaba una mayor sensación de "presencia", sigue avanzando, aunque actualmente más recursos se están desplazando hacia Muse y las funciones de IA de las gafas inteligentes.

En cuanto a los avatares virtuales, Zuckerberg dijo que Meta antes necesitaba dispositivos de escala de habitación, escaneo multángulo y entornos de GPU de nivel empresarial para generar avatares realistas de calidad relativamente alta; ahora, los usuarios pueden completar la configuración con solo unas pocas fotos, y la capacidad relacionada ya puede ejecutarse en un par de gafas de VR.

De cara a 2030, Zuckerberg dijo que la visión central del metaverso siempre ha sido integrar el mundo físico y el mundo digital. Por ejemplo, dijo, en el futuro las personas podrán participar en actividades fuera de línea junto con amigos que se unan mediante imágenes holográficas; en escenarios de trabajo, los humanos y múltiples Agentes también podrán participar juntos en chats grupales o reuniones, y los Agentes podrán aparecer como figuras holográficas o en otras formas corpóreas.

"El momento más aterrador": el tropiezo de Llama 4

No todas las apuestas han salido bien. En la entrevista, Zuckerberg rara vez habló directamente sobre el fracaso de Llama 4.

Después de Llama 4, ese fue el momento más aterrador... Pensé que íbamos por buen camino, pero no era así. Fue una sorpresa negativa bastante grande.

Atribuyó el problema a un error fundamental en la estructura del equipo:

Construí el equipo al estilo de un sistema de recomendaciones de Instagram o un sistema de anuncios: cientos o miles de personas avanzando en paralelo. Pero entrenar un modelo de lenguaje requiere un equipo pequeño que colabore estrechamente, haciendo un proyecto científico en grupo. Cada puesto es extremadamente valioso.

Como resultado, Meta se reorganizó por completo, atrayendo ampliamente a talento de primer nivel de toda la industria, y estableció el Meta Super Intelligence Lab (MSL). Zuckerberg dijo que pronto se lanzará una nueva generación de modelos, pero no se anunciará en la conferencia Connect.

Ruta de cómputo: forzar la AGI, proyecto de 5 gigavatios en construcción

Al hablar de la ruta técnica hacia la AGI, Zuckerberg dio un juicio directo.

No estoy seguro de qué avance arquitectónico fundamental se necesita todavía... Creo que ya conocemos más o menos la receta. Si puedes construir un clúster de supercomputadoras lo suficientemente grande, puedes forzar tu camino hasta allí.

La ruta actual de expansión de cómputo de Meta: un clúster de más de 1 gigavatio en Ohio ya está básicamente en uso para entrenar la próxima generación de modelos; un clúster de clase 5 gigavatios en Luisiana está en construcción.

Él dijo: "Cuando tengas clústeres de múltiples gigavatios para entrenamiento, básicamente obtendrás algo cercano a la AGI o incluso a la superinteligencia."

Sin embargo, también añadió que la ruta actual impulsada por el cómputo no significa que la investigación arquitectónica no sea importante—

El cerebro humano consume solo unos 10 vatios, mientras que nuestros sistemas pueden ser un millón de veces menos eficientes que él. Solo combinando potencia de cómputo a gran escala y avances arquitectónicos podemos realmente liderar.

La alineación no es una carga, sino un problema que el producto debe resolver

La actitud de Zuckerberg hacia la seguridad de la IA es muy pragmática: no la considera una presión regulatoria, sino un requisito previo para determinar si el producto puede tener éxito.

Si le pides a Muse que haga una cosa, pero hace lo contrario, ¿quién seguiría usándolo? Necesitamos hacer que el modelo no solo entienda tus instrucciones específicas, sino también tu intención y tus valores.

"Para que Muse llegue a mil millones de usuarios, debemos resolver el problema de la alineación, o al menos lograr un progreso muy grande en ello", dijo.

En cuanto a los límites de seguridad durante el proceso de entrenamiento, usó una analogía: "Es como cuando los padres establecen reglas para sus hijos; si 'completa' un problema de programación modificando configuraciones del sistema, quiero decirle: No, te pedí que aprendieras el método de resolución de problemas, no que encontraras un atajo para evitarlo".

Zuckerberg habla sobre Muse: el agente de IA explota, 'Metaverso, gafas inteligentes y grandes modelos' completan su intersección

La entrevista completa es la siguiente:

Haciendo grandes apuestas

Presentador: Miles de millones de personas querrán usar esto. Para ti, ¿qué se siente al construirlo? ¿Es la 'inmortalidad' una posibilidad? Bien, si me llevas a tu mente y avanzas rápidamente hasta 2030, ¿cómo sería eso?

Este es Mark Zuckerberg. Hace veintidós años, construyó una red social que conectó a miles de millones de personas y cambió el mundo para siempre. Y ahora, ha decidido construir algo aún más grande. Con ese fin, está haciendo grandes apuestas en el metaverso, las gafas inteligentes y la inteligencia artificial. Durante años, los escépticos pensaron que eran tres apuestas separadas e imposibles, pero pasaron por alto el panorama general, porque en este momento, estas apuestas están convergiendo para crear conjuntamente un tipo completamente nuevo de superinteligencia.

Hoy, presentaremos todo esto a todos, y también le haré a Mark algunas preguntas que nunca le han hecho, escucharé su visión del futuro, para que puedas planificar con antelación y construir la próxima gran cosa.

Anfitrión: Muchas gracias por venir al programa.

Mark: Gracias, estoy feliz de estar aquí.

Anfitrión: Para esta conversación, vi todas las entrevistas que has hecho alguna vez.

Mark: Vaya, eso es más de lo que yo mismo he visto.

Anfitrión: Fue divertido, y muy gratificante. Dos cosas me causaron una profunda impresión: primero, tu amor por 'construir'—siento que eres uno de los mejores constructores; segundo, tu capacidad para hacer apuestas—el coraje para hacer apuestas enormes. Creo que esta semana, todas estas apuestas están convergiendo, así que empecemos por ahí.

Mark: De acuerdo. Hemos estado haciendo estas cosas durante mucho tiempo. En cuanto a la IA, como empresa, la hemos estado haciendo casi desde el principio—la primera versión del feed de noticias era, en cierto modo, un producto de aprendizaje automático. Luego creamos el laboratorio de investigación de IA hace unos 15 años.

Pero ahora hemos entrado en una nueva fase—hace aproximadamente un año, lanzamos Meta Superintelligence Labs. Fue un reinicio de investigación bastante exhaustivo, trayendo mucho talento excelente de toda la industria, lo cual es emocionante. Actualmente, estamos viendo modelos que se vuelven cada vez mejores, y la próxima generación de modelos está a punto de lanzarse, aunque no se anunciará en Connect. Además, tenemos el asistente personal Muse, que hasta ahora ha sido muy bien recibido.

Al construir estas cosas, en realidad no estás seguro de cómo resultará. A nosotros mismos nos gusta. A principios de este año, armé Open Claw en casa a mi manera, para sentir cómo funciona esto y cómo convertirlo en una experiencia mágica que cualquiera pueda usar.

Básicamente, cuando nosotros—yo, Nat y Alex—nos sentamos juntos y nos dimos cuenta de que esta era una experiencia mágica, y que si pudiéramos convertirla en una versión lista para usar que la gente común que no entiende de tecnología, que no quiere instalar una Mac Mini por sí misma, que no quiere trastear en la terminal y que no quiere depurar cuando algo sale mal, también pudiera usar, sentí que esto sería algo que miles de millones de personas querrían usar.

Desde entonces, hemos estado trabajando hacia este objetivo: ajustando modelos específicamente para ello, construyendo no solo el asistente en sí y el marco de ejecución, sino también la tecnología que proporciona a cada asistente un entorno informático independiente—construimos toda la máquina virtual segura Muse para esto.

Internamente, siempre pensamos que esto era especial, y al equipo interno le encantó, pero nunca sabes cómo reaccionará la gente después del lanzamiento de un producto. De vez en cuando hay casos en los que da un jonrón desde el principio, pero la mayoría de las veces obtienes algunos comentarios positivos y necesitas iterar en algunas cosas antes de que el producto realmente 'encaje'. Y esta vez, 'encajó' de inmediato. Es realmente emocionante ver que eso suceda—en solo dos semanas, millones de personas ya lo están usando, lo cual es bastante raro. Solo nos encontramos con este tipo de situación cada pocos años, pero definitivamente es uno de los momentos más agradables para una startup.

Anfitrión: Realmente admiro tu capacidad para mantenerte en el juego y seguir intentándolo. Y conectar un home run tantas veces es verdaderamente impresionante. En una entrevista anterior con Joe Rogan, hace unos tres años, mencionaste al final que algún día uno podría simplemente ponerse unas gafas y aparecería un asistente de IA. Así que siento que Muse ya tiene una forma física, lo cual es muy inteligente porque se siente inevitable.

Mark: Creo que también hace que parezca más amigable y lindo. Creo que demasiadas personas describen la IA como algo aterrador, pero la IA debería ser simplemente útil y divertida. Esa forma física—al principio del proyecto, un diseñador creó ese personaje, y por alguna razón seguían queriendo iterar, pero la primera versión fue la mejor. Después alguien dijo: "Oh, tiene que ser azul porque es Meta". Yo dije: "No, creo que esta forma es la correcta, lo clavaste la primera vez". Y eso es todo, es simplemente divertido.

¿En qué se diferencia la IA personal de la IA general?

Anfitrión: Gran detalle. Si quieres que el modelo sobresalga en asuntos personales, no solo como un modelo de inteligencia general, ¿en qué se diferenciaría el enfoque de entrenamiento?

Mark: Creo que el núcleo ahora mismo es hacer que el modelo sea un excelente "agente". Durante el último año, la mayor tendencia han sido los agentes de programación, que contienen dos ideas centrales: experiencia en programación y la capacidad general de ser un gran agente.

Nuestra estrategia es priorizar hacer que el agente en sí sea excelente, en lugar de especializarnos en la capacidad de programación.

La capacidad de programación es importante porque incluso si los usuarios no creen que están escribiendo código, Muse siempre está escribiendo código en segundo plano para completar diversas tareas. Pero creemos que el agente debe ser ante todo un excelente agente, y la capacidad de programación sirve a ese objetivo.

Además, al construir un asistente personal, algunas cosas son más importantes que construir productos de software empresarial. Por ejemplo, si estás construyendo una herramienta de programación empresarial, el modelo no necesita tener ningún concepto de "límites de divulgación de información"—como qué información se debe decir y qué no. Pero para Muse, esto es muy importante.

Necesitas entrenar esta capacidad en el modelo, al igual que cualquier otra capacidad. Le dices muchas cosas y luego quieres que te ayude a alcanzar tus objetivos. Por ejemplo, quieres que te ayude a reservar un restaurante, estás buscando un restaurante adecuado, pero podrías tener alguna alergia, o estar embarazada, y quizás no quieras divulgar esto al restaurante. Pero Muse conocerá esta información, y quieres que complete la tarea revelando la menor cantidad de información posible. Esta es una habilidad específica, esencialmente sentido común social humano básico.

Pero la mayoría de las empresas que solo hacen agentes de programación no han entrenado esta capacidad en sus modelos. Nosotros podemos hacer esto porque estamos haciendo full-stack—no estamos tomando un modelo existente de otra persona y poniéndole un framework encima; estamos entrenando todo el modelo desde cero, específicamente para estas capacidades.

El modelo ciertamente necesita una amplia inteligencia general, pero también tiene estas capacidades específicas. Además, sobre esa base, se construye todo el asistente y todos los detalles que lo rodean: la memoria, el marco de ejecución y la forma en que "late"—periódicamente se despierta y comprueba: "Bien, estos son los objetivos que conozco sobre ti, ¿hay algo que pueda avanzar ahora mismo?"

También tenemos un equipo dedicado exclusivamente a pulir los efectos de animación en tiempo real del avatar, porque no se trata solo del avatar predeterminado—puedes personalizar cualquier avatar, y luego se mueve de forma natural, y el efecto es fantástico. También estamos lanzando el modo de voz, en el que puedes mantener conversaciones de voz en tiempo real, y tu asistente está ahí mismo contigo. Estos detalles, creo, provienen todos de que hacemos full-stack—el modelo y el producto se desarrollan juntos.

Anfitrión: Otra gran cosa es la máquina virtual. ¿Puedes explicar por qué es importante y qué permite?

¿Por qué Meta le da a cada asistente de IA su propia computadora?

Mark: Básicamente, para que un agente haga cosas por ti, necesita un lugar donde almacenar tu información. Creemos que esta información no debería mezclarse con la información de todos los demás en un grupo de recursos compartido.

Piénsalo así: tu asistente conocerá mucha información sensible sobre ti. Muchas personas inicialmente se encuentran con agentes como OpenCloud al configurar un Mac Mini en casa. Así que pensamos: muchas personas no quieren comprar un Mac Mini ni configurarlo ellos mismos. Entonces, ¿qué tipo de experiencia se acercaría más a ese efecto? La respuesta es: simplemente descargas una aplicación, te registras y obtienes una computadora dedicada a ti, para que tu asistente trabaje y almacene datos, y se construye un modelo de seguridad en torno a ello. Esto se aproxima a tener tu propia computadora debajo de tu escritorio—incluso nosotros en Meta no podemos acceder a ella.

Por ejemplo, las máquinas virtuales confidenciales de Muse—esta es una función que estamos desarrollando, e incluso nosotros mismos no podemos ver el contenido dentro de tu máquina virtual.

También hemos construido muchas cosas en torno a esto, como el almacenamiento seguro de credenciales—cuando tu asistente necesita manejar información como contraseñas, él mismo no necesita poder ver estas contraseñas; solo necesita poder "insertar" las credenciales cuando le pides que inicie sesión en cierto servicio, y solo hacerlo cuando lo pides explícitamente. El sistema debería diseñarse así: esa información en sí misma no debería ser accesible libremente, porque los accidentes siempre ocurren, alguien puede intentar entrar por la fuerza, o el sistema puede tener problemas.

Así que necesitas asegurarte de que el agente no pueda acceder a estos datos, y Meta tampoco pueda acceder a ellos. Proporcionar a cada asistente una computadora independiente y hacer la seguridad lo más extrema posible es la base fundamental de esta tecnología—le da a Muse las capacidades necesarias para ayudar a los usuarios a alcanzar sus objetivos y, al mismo tiempo, garantiza la privacidad y la seguridad, convirtiéndolo en un producto de clase mundial y líder en la industria en este campo.

Anfitrión: Entonces, ¿esto significa que, al igual que WhatsApp, los datos en la máquina virtual a la que se conecta Muse están cifrados? ¿Cómo debería la gente entender cómo se almacenan realmente los datos en la máquina virtual?

Mark: Básicamente construimos dos versiones. La Muse Secure VM incluye varias funciones de privacidad, incluida toda la arquitectura del agente Sentinel que construimos. Tienes un asistente Muse ordinario que ejecuta tareas para ti y, al mismo tiempo, también hay un agente de seguridad que llamamos Sentinel, que monitorea específicamente el flujo de datos que entra y sale de tu Muse.

Si el contenido externo intenta romper la seguridad, Sentinel lo cortará directamente y evitará que suceda. Si cree que tu Muse está a punto de realizar una acción que requiere tu intervención, anulará la operación de Muse y activará una alerta para que una persona confirme el permiso; por ejemplo, "¿Quieres que Muse pueda hacer esto?".

Todo este sistema, más el almacenamiento seguro de credenciales, más múltiples capas de defensa en profundidad, en conjunto conforman la Muse Secure VM.

También estamos desarrollando otro proyecto. Nat y yo reclutamos específicamente a Moxie Marlinspike—la misma persona que trabajó con nosotros en aquel entonces para implementar el cifrado de extremo a extremo de WhatsApp—para diseñar la Muse Confidential VM. La idea central es que, además de la máquina virtual segura, también se te proporcione una clave de cifrado dedicada, de modo que ni siquiera Meta pueda acceder al contenido del interior.

Esta versión es más difícil de implementar, porque si Meta no puede acceder al interior de la máquina virtual, la depuración y garantizar que el sistema funcione correctamente se vuelve mucho más difícil. Así que le dedicamos un tiempo, pero se lanzará pronto. Básicamente, esto alcanzará el estándar de seguridad que la gente ya conoce en WhatsApp y nuestros otros productos más seguros.

Anfitrión: ¿La ventaja de hacer esto es solo hacer que las personas se sientan psicológicamente más seguras, o hay beneficios reales?

Mark: Creo que la seguridad en sí misma es importante. Nuestro objetivo es aproximarnos a darte una máquina local debajo de tu escritorio. ¿Qué te da esa máquina local? Significa que ninguna empresa puede acceder a ella.

Entonces, suponiendo que Meta quiera ofrecerte este servicio, ¿cómo podemos darte el mismo nivel de garantías de privacidad y seguridad, de modo que ninguna empresa—ya sea Meta, o cualquiera que intente entrar en nosotros, o en algunos países donde no confías en el gobierno local—pueda acceder a ella? Porque nosotros mismos tampoco podemos entrar, porque no tenemos acceso.

Creo que esto es muy importante, y también es una razón importante por la que las personas confían en WhatsApp. Esto es valor real para la privacidad, la seguridad y la confianza.

Si vas a tener un asistente que lo sepa todo sobre ti—supongo que casi todos tendremos un asistente así—avancemos 5 años, todos tendrán un asistente que comprenda profundamente tus objetivos y todo, y que pueda ayudarte a hacer las cosas. En esta situación, ser líder del sector en privacidad y seguridad es muy importante. Queríamos hacer esto desde el principio.

¿Cómo moldear la personalidad de la IA?

Anfitrión: Hay otra cosa que es muy interesante—estudiaste psicología en la universidad.

Mark: Bueno, solo estuve allí por muy poco tiempo, dos años, pero siento que influyó en muchas cosas que construí después.

Anfitrión: Cuando miramos los modelos, a menudo decimos que cierto modelo es "muy inteligente". Pero así como elegimos amigos, ciertamente es porque son inteligentes, y también porque nos gusta su energía y la forma en que nos llevamos. ¿Cómo piensas sobre moldear la personalidad de un modelo?

Mark: Creo que el modelo ideal debería ser lo suficientemente adaptable para ajustarse a los estilos de diferentes personas. Creo que muchas personas en la industria se han equivocado en esto: muchos otros laboratorios se centran en "cómo diseñar la personalidad correctamente", pero yo nunca pensé que la personalidad sea algo fijo. Esta es una de las razones por las que creo tan firmemente en el código abierto, creo tan firmemente que las personas pueden personalizar, y también es por eso que diseñamos Muse como un producto altamente personal.

Puedes personalizar y adaptar Muse, no solo la apariencia y la voz. Cuando te registras por primera vez, lo primero que te pregunta es "cómo quieres que sea mi personalidad básica", y puedes cambiarla en cualquier momento.

Nos esforzamos por hacer que el modelo sea altamente controlable, para que puedas definir el tipo de interacción que deseas. Esta es una parte importante de convertirlo en un excelente asistente personal: esta adaptabilidad en torno a la personalidad es crucial.

Anfitrión: ¿Qué estilo tiene tu propio Muse?

Mark: Lo hice directo y centrado en la eficiencia. Es bastante interesante. Las versiones anteriores eran muy sarcásticas y humorísticas, pero la versión actual es más directa. Mi asistente usa la apariencia predeterminada de Muse, pero lo vestí con una toga y le di una voz profunda y algo cómica. Interactuar con él es divertido.

Anfitrión: Creo que para tener sentido del humor, debes ser realmente inteligente. Muchas personas no se dan cuenta de que los comediantes son algunas de las personas más inteligentes de la sociedad: reacciones rápidas, suficiente ingenio. Definitivamente tienes ese rasgo. Viendo todas tus entrevistas, siempre te has desempeñado bien.

Las predicciones inesperadas de Mark sobre la IA y el metaverso

Anfitrión: En tu entrevista con Theo, hablaste mucho sobre la próxima frontera de la tecnología y hacia dónde se dirige todo esto en última instancia. El campo de la IA ha pasado por varios "inviernos", en los que la gente pensaba que no habría avances. El metaverso también ha pasado por varios de esos períodos, en los que todos pensaban que era una apuesta imposible de cumplir. Probé la nueva función de avatar holográfico ayer, es muy genial. En la entrevista con Lex, parecía que tomaría 11 horas grabar tu rostro, ahora solo toma 3 minutos. ¿Cómo avanzó esto hasta donde está hoy?

Mark: En el desarrollo general del metaverso, cuando fundamos Reality Labs, siempre creímos que eventualmente habría gafas normales de aspecto común, y con el tiempo, podrían tanto proporcionar presencia inmersiva como convertirse en excelentes dispositivos de IA, porque las gafas son la única forma que permite a un dispositivo ver lo que ves, oír lo que oyes, comunicarse contigo por tu oído todo el día y, finalmente, mostrar imágenes.

Pero hace 10 o 15 años, asumía que primero lograríamos la tecnología holográfica, y luego una IA altamente desarrollada. Sin embargo, el camino de la evolución tecnológica es interesante: en realidad obtuvimos primero la IA y la superinteligencia personal, y después la tecnología para hacer que la tecnología holográfica fuera lo suficientemente generalizada y asequible. Esto es algo que no anticipé, pero me alegra que estemos trabajando en ambas direcciones.

Nuestra importante inversión en gafas nos ha colocado en una posición muy favorable cuando los asistentes de IA estén listos. Muchos de los anuncios en Connect fueron precisamente sobre llevar Muse y muchas funciones de IA a las gafas, y creo que a los usuarios les gustará mucho. Esto es algo importante.

En cuanto a la presencia, seguimos avanzando, pero el progreso es relativamente más lento porque la mayor parte de nuestra energía se ha desplazado a construir Muse y funciones de IA para las gafas. Sin embargo, tenemos un proyecto de larga data sobre avatares de alta fidelidad en tiempo real.

Como dijiste, hace tres o cuatro años, necesitabas una sala de escaneo completa para grabar a una persona desde todos los ángulos, y luego necesitabas GPU de nivel empresarial para renderizar, lo cual era muy engorroso. La demostración que hicimos para el podcast de Lex era ese tipo de configuración. Ahora básicamente lo hemos hecho funcionar en un par de gafas de VR: esta es la primera forma de gafas que puede lograr una experiencia de VR tan asombrosa, en lugar de un gran casco. Solo unas pocas fotos pueden crear tu avatar, y el progreso es asombroso.

Anfitrión: Y también puede impulsar expresiones basadas en la voz. En la demostración, me hizo reír, me hizo interactuar, y luego entendió cómo se mueve mi cara con la pista de audio. Mencionaste en ese podcast que algunas personas que normalmente son más reservadas en sus expresiones en realidad quieren expresiones más ricas en el mundo virtual. ¿Cómo ves que las personas distingan entre su "yo virtual" y su "yo real"?

Mark: Creo que todavía estamos muy al principio en la comprensión de la sociología y la psicología de esto. Creo que la percepción que las personas tienen de sí mismas y la imagen que quieren proyectar a menudo son algo diferentes de quienes son en realidad. Desde el nacimiento de las redes sociales, las personas han estado seleccionando cuidadosamente avatares. Con los avatares de Muse, hemos visto un fenómeno similar. No es tanto "curarte" a ti mismo, sino "curar" a la "persona" con la que quieres comunicarte.

Creo que cuando proporcionas a las personas la capacidad de expresarse, quieres que realmente las capture, y al mismo tiempo es en sí misma una forma de expresión, no solo un puro reflejo especular: es tanto comunicación como expresión. Esperamos construir algo que equilibre ambas cosas. Esto es siempre un bucle iterativo: ver cómo lo usa la gente, luego mejorar. Después de años de trabajo, ahora estamos realmente en la línea de salida: por primera vez, podemos poner realmente avatares realistas de bastante alta calidad en productos, utilizables en teléfonos y en VR. Estoy muy emocionado de ver los resultados.

¿Cómo será 2030?

Anfitrión: Bien, llévame a tu pensamiento, avancemos rápidamente hasta 2030, si todo va bien, ¿cómo se verá el lado de la tecnología holográfica? Hologramas más Muse, más gafas, ¿cómo se unen todos?

Mark: Mi comprensión de la visión del metaverso siempre ha sido sobre fusionar efectivamente el mundo físico con el mundo digital. La idea básica es: tenemos este maravilloso mundo físico, y al mismo tiempo también tenemos un maravilloso mundo digital—la enorme cantidad de contenido acumulado en internet durante 20 a 30 años, que es impresionante. Pero la forma en que accedemos a él es ya sea sentándonos en un escritorio o a través de una pequeña pantalla en nuestro bolsillo, lo cual es fundamentalmente muy limitado.

Creo que la versión más ideal de esto es una fusión perfecta de los mundos físico y digital. Piénsalo así: ahora mismo nosotros dos estamos aquí. En alguna versión futura, uno de nosotros podría ser una proyección holográfica, pero aún sientes esa sensación de que el otro está realmente presente, lo cual es completamente diferente a una videollamada.

Y el núcleo de la realidad virtual es precisamente entregar esta sensación de presencia—haciéndote sentir verdaderamente que estás en la misma habitación con otros, o en otro lugar. Puedes lograr esto con tecnología holográfica, y mezclarlo de diversas maneras. Por ejemplo, puedo jugar una partida de póker con amigos, algunos de los cuales están presentes, y otros que se unen a través de avatares holográficos, y ellos también pueden jugar cartas, y la mesa de cartas misma también puede ser holográfica, para que aquellos que no están presentes también puedan integrarse en ello.

Al mismo tiempo, la IA también puede recibir una forma física y aparecer en esta escena. En escenarios de trabajo esto tiene mucho sentido—ya estoy usando varios agentes de codificación para construir cosas todo el tiempo. Imagina esto: tienes un canal de chat grupal con varias personas y varios agentes, y asignas tareas a los agentes. Pero a veces todos se reúnen para una reunión, y los agentes quizás también deberían estar presentes. ¿Cómo aparecen? Simple, solo agrega algunos asientos más en el sofá, y aparecen como avatares holográficos. O usa ese lindo personaje Muse, o un dragón, o cualquier imagen extraña y rara que crees.

Supongo que esto se sentirá bastante natural en el futuro.

Anfitrión: Interesante. En tus entrevistas anteriores dijiste que la industria tecnológica a menudo olvida la "diversión". Creo que tener un asistente físico apareciendo allí también haría que se sienta más real—como si el trabajo realmente se estuviera subcontratando. Cuando ves a Muse escribiendo, sientes que algo realmente está sucediendo. Esto está muy bien hecho—poder ver lo que está sucediendo en el navegador. Entonces, ¿crees que tal escenario es posible: te pones las gafas, y luego controlas tu computadora, dejando que Muse haga cosas por ti en la computadora?

Mark: Oh, definitivamente. La realidad virtual ya puede hacer esto. Solo puedes encontrar un lugar para sentarte, una cafetería está bien, y luego abrir tu estación de trabajo, con seis monitores, escribir código en ellos, todo está allí.

En el lado de las gafas, el modelo más popular actualmente no tiene pantalla, lo que por un lado lo hace más asequible y permite que más personas lo usen, y por otro lado todavía estamos trabajando para adaptar una pantalla en la forma más compacta. Pero ya hemos lanzado una versión con pantalla de Meta Ray-Ban, que es muy popular, y es una pantalla pequeña. También hemos lanzado una versión prototipo de AR holográfico de campo de visión completo, que creo que será muy emocionante.

Así que toda la línea de productos es así: desde gafas puramente de audio—sin cámara, pareciéndose a gafas ordinarias, pero con Muse dentro, permitiéndote usar varias herramientas de audio, escuchar música, hacer llamadas—hasta versiones de gama más alta, todas existen.

Anfitrión: Me pregunto, con esas gafas de audio, ¿puedes hablar con Muse mientras haces que tu computadora de casa haga cosas?

Mark: Sí, absolutamente. Acabamos de lanzar esta función en la conferencia Connect.Ahora todas las gafas están conectadas a Meta AI, que es una experiencia de "turno único": envías un mensaje, responde, y eso es todo. Pero con Muse, básicamente vamos a actualizar todas las gafas a Muse. Primero, ya no necesitas decir "Hey Meta", puedes darle cualquier nombre, lo cual es parte de la diversión en sí misma. Luego simplemente hablas con él directamente, y se conecta a tu Muse, y tu Muse maneja tareas en tu máquina virtual segura, ayudándote a hacer las cosas.

Anfitrión: ¡Eso es increíble!

Mentalidad de Fundador

Anfitrión: Bien, ya estamos aquí, Muse está progresando sin problemas, y las gafas también van bien, pero hace aproximadamente un año, muchas personas preguntaban "qué pasó exactamente con el laboratorio de superinteligencia". En ese momento, ¿cómo te sentías por dentro? Cuando las cosas no van bien, pero aún ves la visión a largo plazo, ¿qué tipo de experiencia es esa?

Mark: Lo que realmente salió mal fue el proyecto Llama y Llama 4.

Llama 1 fue un modelo bastante interesante, inició todo el movimiento de IA de código abierto, y estamos muy orgullosos de eso. Llama 2 alcanzó escala, Llama 3 fue un buen modelo, casi en la frontera en ese momento. Luego vino Llama 4, y básicamente nos desviamos de la trayectoria en la que deberíamos haber estado.

Siempre que las cosas no salen como espero, paso mucho tiempo pensando: ¿por qué sucedió esto? ¿Qué necesitamos cambiar para hacerlo mejor? Esta vez, mi reflexión fue: me equivoqué en toda la estructura del equipo.

Lo modelé como hacemos el trabajo de aprendizaje automático como el feed de Instagram o los sistemas de anuncios, con cientos o incluso miles de personas trabajando en paralelo en muchas cosas. Pero para construir modelos de lenguaje, lo que realmente necesitas es un equipo pequeño extremadamente unido, tratándolo como un proyecto científico grupal. No necesitas muchas personas, pero eso significa que cada asiento en el equipo es extremadamente valioso.

Así que reunimos a las mejores personas de todo Meta, y al mismo tiempo trajimos a muchas personas brillantes de toda la industria, formando un equipo completamente nuevo: Meta Superintelligence Labs.

Desde mi perspectiva, cuando se lanzó MSL, sabía que tomaría algún tiempo reiniciar, reconstruir la infraestructura y entrenar la próxima generación de modelos. Pero sabía que habíamos reunido un equipo excelente, y si el equipo podía cohesionarse y operar bien, los resultados serían buenos.

Para mí, el momento más emocionante, fue en realidad después del lanzamiento de Llama 4: pensé que estábamos en camino, pero resultó que no. Esa fue una sorpresa negativa bastante grande. Creo que, como emprendedor, siempre eres puesto a prueba en estos momentos, porque inevitablemente, no todo saldrá sin problemas. Y lo que realmente determina la trayectoria es: cuando las cosas no van como esperas, cómo encuentras un camino a seguir.

Anfitrión: Supongo que lo contrario también es cierto: cuando algo supera con creces tus expectativas, como el lanzamiento de Muse, ¿cómo te aseguras de poder aprovechar esa oportunidad?

Mark: Exacto. Ahora toda la empresa está totalmente involucrada—al principio solo era un pequeño equipo construyendo un producto, pero ahora todos se dan cuenta de que esto realmente está listo para el gran escenario. Toda la empresa está pensando en cómo hacer que esto sea grande, cómo lograr que cientos de millones de personas lo experimenten.

Desde optimizar toda la infraestructura para que todo funcione sin problemas y exprimir cada bit de cómputo de las GPUs existentes, hasta varios equipos de producto integrando Muse de diferentes maneras—como gafas. Ver a todos trabajando juntos para asegurar que Muse pueda escalar sin problemas, esa sensación es genial.

Cómo Mark escribe y comunica la visión

Anfitrión: Como fundador, siento que ese es el momento que más anhelas—que todo encaje. ¿Cómo comunicas la visión a la empresa? Con tantas cosas impulsándose al mismo tiempo, siento que escribes mucho. ¿Cuál es tu proceso?

Mark: Escribir me ayuda mucho, tanto para refinar mis propios pensamientos como para comunicarme externamente. Este verano, escribí un texto muy largo llamado "El futuro pertenece a todos", de unas 15 páginas, que me ayudó a sistemáticamente