Zuckerberg fala sobre o Muse: a explosão dos agentes de IA e o encontro das três grandes apostas — metaverso, óculos inteligentes e grandes modelos

Agente de IALlama 4MetaMuseÓculos inteligentesAGIMetaverso
há 1 horaFonte: blockweeks.com
Zuckerberg fala sobre o Muse: a explosão dos agentes de IA e o encontro das três grandes apostas — metaverso, óculos inteligentes e grandes modelos

Autor: Long Yue, Wallstreetcn

Três anos atrás, o CEO da Meta, Zuckerberg, disse no programa de Joe Rogan que um dia, quando as pessoas colocarem óculos, um Agente de IA aparecerá com elas. Agora, essa cena pode estar acontecendo.

O Agente de IA pessoal da Meta, Muse, alcançou milhões de usuários em duas semanas após o lançamento. Zuckerberg disse em um programa de entrevista em 25 de setembro: "A cada poucos anos, conseguimos algo assim." Ele caracterizou a recepção inicial do Muse como "um home run logo de cara"—o que é raro na história de produtos da Meta.

Ao mesmo tempo, ele anunciou que o Muse será integrado a toda a linha de óculos inteligentes Ray-Ban, e os usuários não precisarão mais dizer "Hey Meta", mas poderão personalizar uma palavra de ativação para chamar diretamente seu próprio Agente de IA pessoal.

Por anos, o metaverso, os óculos inteligentes e os grandes modelos, que o mundo exterior via como três apostas independentes, estão acelerando sua convergência no nível de produto interno da Meta.

Nesta entrevista, Zuckerberg também admitiu que o fracasso do Llama 4 foi o "momento mais assustador", e revelou que a Meta está construindo um cluster de treinamento de 5 gigawatts, acreditando que computação suficientemente grande pode "forçar" a AGI.

Zuckerberg fala sobre Muse: Agente de IA explode, 'metaverso, óculos inteligentes e grandes modelos' três grandes apostas completam sua convergência

Por que o Muse pode ser "um home run logo de cara"

O ponto de partida do Muse foi Zuckerberg sentar-se com os membros da equipe Nat e Alex, usando ferramentas de código aberto para "montar" uma versão inicial em casa.

"Percebemos que essa era uma experiência mágica", disse Zuckerberg, "se pudéssemos torná-la algo que qualquer pessoa possa usar—sem precisar comprar um Mac Mini, sem precisar mexer no terminal—então isso seria algo que bilhões de pessoas iriam querer usar."

Esse julgamento impulsionou toda a lógica de P&D subsequente: não apenas treinar modelos, mas autodesenvolvimento full-stack desde o modelo, a estrutura, até o mecanismo de "batimento cardíaco" do Agente—o Agente acordará automaticamente periodicamente, verificará os objetivos do usuário e avançará proativamente os itens a fazer.

Os dados pós-lançamento confirmaram esse julgamento. Duas semanas, milhões de usuários.

IA Pessoal: o foco é execução, memória e "julgamento"

Sobre a diferença entre IA pessoal e IA geral, Zuckerberg resumiu o foco atual da competição como tornar os modelos melhores Agentes.

"A maior coisa no ano passado é basicamente Agentes de codificação." Ele disse que a capacidade de codificação é importante porque, mesmo que os usuários não estejam escrevendo código diretamente, "sua Musa também estará escrevendo código para você em segundo plano o tempo todo, para realizar várias coisas."

Mas ele acredita que um Agente pessoal não pode ter apenas capacidades de codificação ou execução de tarefas; ele também precisa entender limites de privacidade e contexto social.

Zuckerberg deu um exemplo: quando um usuário pede à Musa para reservar um restaurante, o Agente pode saber informações como alergias ou gravidez do usuário, mas isso não significa que essa informação deva ser divulgada automaticamente. "Você quer que ele complete a tarefa divulgando o mínimo de informações possível."

Ele disse que essa capacidade pertence às "habilidades sociais básicas ou senso comum" que os humanos geralmente possuem, mas se as empresas estão apenas treinando Agentes de codificação, muitas delas não a incorporaram ao escopo de capacidade do modelo.

"Nós treinamos o modelo inteiro, em vez de pegar o modelo pronto de outra pessoa e construir uma estrutura e um Agente em torno dele", disse Zuckerberg.A Meta também adicionou recursos no nível do produto, como memória, rastreamento de tarefas, animação de personagens virtuais e interação de voz em tempo real.

Sobre personalização, ele disse que a Meta não acredita que a IA deva ter apenas uma personalidade fixa. "Muitos laboratórios estão focados em como ajustar a personalidade para o estado certo, mas eu nunca acreditei que exista apenas uma resposta correta para a personalidade."

Ele disse que a Musa permite aos usuários modificar o avatar, a voz e a personalidade básica, e o modelo foi projetado para ser altamente controlável. "Você pode definir como deseja interagir com ele, o que é muito importante para um Agente pessoal."

Cada Agente tem seu próprio "computador"

Uma das principais diferenças de infraestrutura entre a Musa e outros produtos de IA é que a Meta equipa cada Agente com sua própria VM Segura.

Zuckerberg explicou por que isso é necessário:

Seu Agente saberá muitas informações sensíveis sobre você. Não acreditamos que essas informações devam ser misturadas em um único pool com os dados de todos os outros.

Ele comparou a Muse Secure VM a "aquele computador embaixo da sua mesa que pertence apenas a você" — os dados do usuário são armazenados criptografados, e credenciais sensíveis, como senhas, são gerenciadas por meio de um módulo de segurança independente que o próprio Agente não pode ler diretamente.

Com base nisso, a Meta também projetou um Agente de segurança "Sentinel" especificamente para monitorar os fluxos de dados que entram e saem do Muse. Assim que anomalias ou operações de alto risco forem detectadas, ele as interceptará diretamente e solicitará autorização ao usuário.

O metaverso, os óculos inteligentes e os Agentes: três caminhos estão convergindo

Na entrevista, Zuckerberg revelou que o Muse será totalmente integrado à série de óculos inteligentes Ray-Ban e atualizará o método de interação existente.

Os óculos atuais oferecem uma experiência de "conversa de turno único" — diga uma coisa, receba uma resposta, e acaba. Após integrar o Muse, os óculos se tornam o ponto de entrada front-end para o Agente: o usuário fala, e o Muse no back-end continua trabalhando na Secure VM, depois retorna assim que a tarefa é concluída.

Em relação ao roteiro de produto para os óculos, ele descreveu uma escada de hardware clara:

  • Óculos somente de áudio sem câmera: já equipados com Muse, podem lidar com chamadas, música e tarefas de voz
  • Meta Ray-Ban com um pequeno display: já lançado, com feedback visual básico
  • Protótipo de AR holográfico com campo de visão completo: já lançado, que Zuckerberg chamou de "muito empolgante"

Ele disse que o investimento de longo prazo da Meta em óculos coloca a empresa em uma posição relativamente favorável assim que os Agentes de IA amadurecerem.A Meta está trazendo o Muse e mais recursos de IA para seus produtos de óculos, enquanto a tecnologia do metaverso, que antes enfatizava um maior senso de "presença", ainda avança, embora mais recursos estejam atualmente migrando para o Muse e os recursos de IA dos óculos inteligentes.

Quanto aos avatares virtuais, Zuckerberg disse que a Meta antes precisava de dispositivos em escala de sala, escaneamento em múltiplos ângulos e ambientes de GPU de nível empresarial para gerar avatares realistas de qualidade relativamente alta; agora, os usuários podem concluir a configuração com apenas algumas fotos, e o recurso relacionado já pode rodar em um par de óculos de VR.

Olhando para 2030, Zuckerberg disse que a visão central do metaverso sempre foi integrar o mundo físico e o mundo digital. Por exemplo, ele disse, no futuro as pessoas poderão participar de atividades offline junto com amigos que se juntam por meio de imagens holográficas; em cenários de trabalho, humanos e múltiplos Agentes também poderão participar juntos de chats em grupo ou reuniões, e os Agentes poderão aparecer como figuras holográficas ou em outras formas corporificadas.

"O Momento Mais Assustador": O Deslize do Llama 4

Nem todas as apostas correram bem. Na entrevista, Zuckerberg raramente falou diretamente sobre o fracasso do Llama 4.

Depois do Llama 4, esse foi o momento mais assustador... Eu pensei que estávamos no caminho certo, mas não estávamos. Foi uma surpresa negativa bastante grande.

Ele atribuiu o problema a um erro fundamental na estrutura da equipe:

Eu construí a equipe no estilo de um sistema de recomendação do Instagram ou de um sistema de anúncios - centenas ou milhares de pessoas avançando em paralelo. Mas treinar um modelo de linguagem requer uma equipe pequena e altamente colaborativa, fazendo isso como um projeto científico em grupo. Cada posição é extremamente valiosa.

Como resultado, a Meta se reorganizou completamente, trazendo amplamente talentos de ponta de toda a indústria, e estabeleceu o Meta Super Intelligence Lab (MSL). Zuckerberg disse que uma nova geração de modelos será lançada em breve, mas não será anunciada na conferência Connect.

Rota de Computação: Forçando Bruta a AGI, Projeto de 5 Gigawatts em Construção

Ao falar sobre o caminho técnico para AGI, Zuckerberg deu um julgamento direto.

Não tenho certeza de qual avanço arquitetônico fundamental ainda é necessário... Acho que já sabemos aproximadamente a receita. Se você puder construir um cluster de supercomputadores grande o suficiente, você pode forçar bruta o caminho até lá.

A rota atual de expansão de computação da Meta: um cluster de mais de 1 gigawatt em Ohio já está basicamente em uso para treinar a próxima geração de modelos; um cluster de classe de 5 gigawatts na Louisiana está em construção.

Ele disse, "Quando você tem clusters de múltiplos gigawatts para treinamento, você basicamente obterá algo próximo de AGI ou até superinteligência."

No entanto, ele também acrescentou que a rota atual impulsionada por computação não significa que a pesquisa arquitetônica não seja importante -

O cérebro humano consome apenas cerca de 10 watts, enquanto nossos sistemas podem ser um milhão de vezes menos eficientes que ele. Somente combinando poder computacional em larga escala e avanços arquitetônicos podemos realmente liderar.

Alinhamento Não É um Fardo, mas um Problema que o Produto Deve Resolver

A atitude de Zuckerberg em relação à segurança da IA é muito pragmática - ele não a considera como pressão regulatória, mas como um pré-requisito para o sucesso do produto.

Se você pedir ao Muse para fazer uma coisa, mas ele fizer o oposto, quem ainda o usaria? Precisamos fazer com que o modelo não apenas entenda suas instruções específicas, mas também entenda sua intenção e seus valores.

"Para o Muse alcançar um bilhão de usuários, precisamos resolver o problema de alinhamento, ou pelo menos fazer um progresso muito grande nisso." ele disse.

Em relação aos limites de segurança durante o processo de treinamento, ele usou uma analogia: "É como os pais estabelecendo regras para seus filhos—se ele 'completa' um problema de programação modificando configurações do sistema, eu quero dizer a ele: Não, eu pedi para você aprender o método de resolução de problemas, não para encontrar um atalho para contorná-lo."

Zuckerberg fala sobre o Muse: AI Agent explode, 'Metaverso, óculos inteligentes e grandes modelos' três grandes apostas completam sua interseção

A entrevista completa é a seguinte:

Fazendo Grandes Apostas

Apresentador: Bilhões de pessoas vão querer usar isso. Para você, como é sentir que está construindo isso? A 'imortalidade' é uma possibilidade? Ok, se você me levar para dentro da sua mente e avançar rapidamente para 2030, como isso seria?

Este é Mark Zuckerberg. Vinte e dois anos atrás, ele construiu uma rede social que conectou bilhões de pessoas e mudou o mundo para sempre. E agora, ele decidiu construir algo ainda maior. Para isso, ele está fazendo grandes apostas no metaverso, em óculos inteligentes e em inteligência artificial. Por anos, os céticos pensaram que eram três apostas separadas e impossíveis, mas eles não perceberam o quadro maior—porque agora, essas apostas estão convergindo para criar conjuntamente um tipo totalmente novo de superinteligência.

Hoje, vamos apresentar tudo isso a todos, e também farei a Mark algumas perguntas que ele nunca foi questionado antes, ouvirei sua visão para o futuro, para que você possa se planejar com antecedência e construir a próxima grande coisa.

Apresentador: Muito obrigado por vir ao programa.

Mark: Obrigado, estou feliz por estar aqui.

Apresentador: Para esta conversa, assisti a todas as entrevistas que você já fez.

Mark: Uau, isso é mais do que eu mesmo assisti.

Apresentador: Foi divertido e muito gratificante. Duas coisas me impressionaram profundamente: primeiro, seu amor por 'construir'—sinto que você é um dos melhores construtores; segundo, sua capacidade de fazer apostas—a coragem de fazer apostas enormes. Acho que esta semana, todas essas apostas estão convergindo, então vamos começar por aí.

Mark: Ok. Fazemos essas coisas há muito tempo. Em relação à IA, como empresa, fazemos isso quase desde o início—a primeira versão do feed de notícias era, de certa forma, um produto de aprendizado de máquina. Depois criamos o laboratório de pesquisa em IA há cerca de 15 anos.

Mas agora entramos em uma nova fase—cerca de um ano atrás, lançamos o Meta Superintelligence Labs. Foi um recomeço de pesquisa bastante completo, trazendo muitos talentos excelentes de toda a indústria, o que é empolgante. Atualmente, estamos vendo os modelos ficarem cada vez melhores, e a próxima geração de modelos está prestes a ser lançada, embora não seja anunciada no Connect. Além disso, temos o assistente pessoal Muse, que até agora foi muito bem recebido.

Ao construir essas coisas, você na verdade não tem certeza de como vai ficar. Nós mesmos gostamos. No início deste ano, montei o Open Claw em casa do meu jeito, para sentir como essa coisa funciona e como transformá-la em uma experiência mágica que qualquer pessoa possa usar.

Basicamente, quando nós—eu, Nat e Alex—nos sentamos juntos e percebemos que era uma experiência mágica, e que se pudéssemos transformá-la em uma versão pronta para uso que pessoas comuns que não entendem de tecnologia, não querem instalar um Mac Mini sozinhas, não querem mexer no terminal e não querem depurar quando algo dá errado também pudessem usar, senti que isso seria algo que bilhões de pessoas iriam querer usar.

Desde então, temos trabalhado em direção a esse objetivo: ajustando modelos especificamente para isso, construindo não apenas o assistente em si e a estrutura de execução, mas também a tecnologia que fornece a cada assistente um ambiente de computação independente—construímos toda a máquina virtual segura Muse para isso.

Internamente, sempre achamos que isso era especial, e a equipe interna adorou, mas você nunca sabe como as pessoas vão reagir após o lançamento de um produto. Ocasionalmente há casos em que acerta em cheio logo de cara, mas na maioria das vezes você recebe algum feedback positivo e precisa iterar em algumas coisas antes que o produto realmente "engate". E desta vez, "engatou" imediatamente. É realmente empolgante ver isso acontecer—em apenas duas semanas, milhões de pessoas já estão usando, o que é bastante raro. Só encontramos esse tipo de situação a cada poucos anos, mas é definitivamente um dos momentos mais agradáveis para uma startup.

Apresentador: Eu realmente admiro sua capacidade de permanecer no jogo e continuar tentando. E acertar um home run tantas vezes é realmente impressionante. Em uma entrevista anterior com Joe Rogan, cerca de três anos atrás, você mencionou no final que um dia você poderia simplesmente colocar óculos e um assistente de IA apareceria. Então eu sinto que o Muse já tem uma forma física, o que é muito inteligente porque parece inevitável.

Mark: Eu acho que também faz parecer mais amigável e fofo. Acho que muitas pessoas descrevem a IA como algo assustador, mas a IA deveria ser apenas útil e divertida. Essa forma física—no início do projeto, um designer criou aquele personagem, e por algum motivo eles continuaram querendo iterar, mas a primeira versão foi a melhor. Depois alguém disse: "Ah, tem que ser azul porque é da Meta." Eu disse: "Não, acho que esta forma está certa, você acertou de primeira." E é isso, é simplesmente divertido.

Como a IA pessoal é diferente da IA geral?

Apresentador: Ótimo detalhe. Se você quer que o modelo se destaque em questões pessoais, não apenas como um modelo de inteligência geral, como a abordagem de treinamento seria diferente?

Mark: Eu acho que o núcleo agora é fazer do modelo um excelente "agente". No último ano, a maior tendência foram os agentes de codificação, que contêm duas ideias centrais: expertise em codificação e a capacidade geral de ser um ótimo agente.

Nossa estratégia é priorizar tornar o próprio agente excelente, em vez de se especializar em capacidade de codificação.

A capacidade de codificação é importante porque mesmo que os usuários não pensem que estão escrevendo código, o Muse está sempre escrevendo código em segundo plano para completar várias tarefas. Mas acreditamos que o agente deve, antes de tudo, ser um excelente agente, e a capacidade de codificação serve a esse objetivo.

Além disso, ao construir um assistente pessoal, algumas coisas são mais importantes do que construir produtos de software empresarial. Por exemplo, se você está construindo uma ferramenta de codificação empresarial, o modelo não precisa ter nenhum conceito de "limites de divulgação de informações"—como quais informações devem ser ditas e quais não devem. Mas para o Muse, isso é muito importante.

Você precisa treinar essa capacidade no modelo, assim como qualquer outra capacidade. Você conta muitas coisas a ele, e então quer que ele o ajude a alcançar seus objetivos. Por exemplo, você quer que ele o ajude a reservar um restaurante, você está procurando um restaurante adequado, mas você pode ter alguma alergia, ou estar grávida, e talvez não queira divulgar isso ao restaurante. Mas o Muse saberá dessa informação, e você quer que ele complete a tarefa revelando o mínimo de informação possível. Esta é uma habilidade específica, essencialmente senso comum social humano básico.

Mas a maioria das empresas que apenas fazem agentes de codificação não treinou essa capacidade em seus modelos. Podemos fazer isso porque estamos fazendo full-stack—não estamos pegando um modelo existente de outra pessoa e colocando uma estrutura nele; estamos treinando o modelo inteiro do zero, especificamente para essas capacidades.

O modelo certamente precisa de uma ampla inteligência geral, mas também possui essas habilidades específicas. Além disso, sobre essa base, você constrói todo o assistente e todos os detalhes ao seu redor: memória, a estrutura de execução e a maneira como ele "pulsa"—ele periodicamente desperta e verifica: "Certo, esses são os objetivos que eu conheço sobre você, há algo que eu possa adiantar agora?"

Também temos uma equipe dedicada exclusivamente a aprimorar os efeitos de animação em tempo real do avatar, porque não é apenas o avatar padrão—você pode personalizar qualquer avatar, e então ele se move naturalmente, e o efeito é fantástico. Também estamos lançando o modo de voz, no qual você pode ter conversas de voz em tempo real, e seu assistente está bem ali com você. Esses detalhes, eu acho, todos decorrem de fazermos full-stack—o modelo e o produto são desenvolvidos juntos.

Apresentador: Outra grande coisa é a máquina virtual. Você pode explicar por que ela é importante e o que ela possibilita?

Por que a Meta dá a cada assistente de IA seu próprio computador?

Mark: Basicamente, para um agente fazer coisas por você, ele precisa de um lugar para armazenar suas informações. Acreditamos que essas informações não devem ser misturadas com as informações de todos os outros em um pool de recursos compartilhado.

Pense assim: seu assistente saberá muitas informações sensíveis sobre você. Muitas pessoas inicialmente encontram agentes como o OpenCloud montando um Mac Mini em casa. Então pensamos: muitas pessoas não querem comprar um Mac Mini ou configurá-lo sozinhas. Então, que tipo de experiência melhor se aproximaria desse efeito? A resposta é: você apenas baixa um aplicativo, se cadastra e recebe um computador dedicado a você, para o seu assistente trabalhar e armazenar dados, e constrói um modelo de segurança em torno disso. Isso se aproxima de ter seu próprio computador embaixo da sua mesa—nem nós, na Meta, podemos acessá-lo.

Por exemplo, máquinas virtuais confidenciais Muse—este é um recurso que estamos desenvolvendo, e nem nós mesmos podemos ver o conteúdo dentro da sua máquina virtual.

Também construímos muitas coisas em torno disso, como armazenamento seguro de credenciais—quando seu assistente precisa lidar com informações como senhas, ele próprio não precisa ser capaz de ver essas senhas; ele só precisa ser capaz de "inserir" as credenciais quando você pede que ele faça login em um determinado serviço, e apenas fazer isso quando você pede explicitamente. O sistema deveria ser projetado assim: essa informação em si não deveria ser livremente acessível, porque acidentes sempre acontecem, alguém pode tentar invadir, ou o sistema pode ter problemas.

Então você precisa garantir que o agente não possa acessar esses dados, e a Meta também não possa acessá-los. Proporcionar a cada assistente um computador independente e tornar a segurança o mais extrema possível é a base fundamental dessa tecnologia—ela tanto dá ao Muse as capacidades necessárias para ajudar os usuários a alcançar seus objetivos, quanto garante privacidade e segurança, tornando-o um produto de classe mundial e líder do setor nesse campo.

Apresentador: Então isso significa que, assim como o WhatsApp, os dados na máquina virtual à qual o Muse se conecta são criptografados? Como as pessoas devem entender como os dados são realmente armazenados na máquina virtual?

Mark: Nós basicamente construímos duas versões. A Muse Secure VM inclui vários recursos de privacidade, incluindo toda a arquitetura do agente Sentinel que construímos. Você tem um assistente Muse comum que está executando tarefas para você e, ao mesmo tempo, também há um agente de segurança que chamamos de Sentinel, monitorando especificamente o fluxo de dados que entra e sai do seu Muse.

Se conteúdo externo tentar quebrar a segurança, o Sentinel irá cortá-lo diretamente e impedir que isso aconteça. Se ele acreditar que seu Muse está prestes a tomar uma ação que exige sua intervenção, ele irá sobrepor a operação do Muse e acionar um alerta para uma pessoa confirmar a permissão—por exemplo, "Você quer que o Muse seja capaz de fazer isso?"

Todo esse sistema, mais o armazenamento seguro de credenciais, mais várias camadas de defesa em profundidade, juntos compõem a Muse Secure VM.

Também estamos desenvolvendo outro projeto. Nat e eu recrutamos especificamente Moxie Marlinspike—a própria pessoa que trabalhou conosco na época para implementar a criptografia de ponta a ponta do WhatsApp—para projetar a Muse Confidential VM. A ideia central é que, além da máquina virtual segura, você também recebe uma chave de criptografia dedicada, de modo que nem mesmo a Meta possa acessar o conteúdo interno.

Esta versão é mais difícil de implementar, porque se a Meta não pode acessar o interior da máquina virtual, depurar e garantir que o sistema funcione corretamente se torna muito mais difícil. Então passamos algum tempo nisso, mas será lançada em breve. Isso basicamente alcançará o padrão de segurança que as pessoas já conhecem no WhatsApp e em nossos outros produtos mais seguros.

Host: A vantagem de fazer isso é apenas fazer as pessoas se sentirem psicologicamente mais seguras, ou há benefícios reais?

Mark: Eu acho que a segurança em si é importante. Nosso objetivo é aproximar-se de dar a você uma máquina local embaixo da sua mesa. O que essa máquina local lhe dá? Significa que nenhuma empresa pode acessá-la.

Então, assumindo que a Meta queira lhe fornecer este serviço, como podemos lhe dar o mesmo nível de garantias de privacidade e segurança, para que nenhuma empresa—seja a Meta, ou qualquer um tentando nos invadir, ou em alguns países onde você não confia no governo local—possa acessá-la? Porque nós mesmos também não podemos entrar, porque não temos acesso.

Eu acho isso muito importante, e também é uma razão importante pela qual as pessoas confiam no WhatsApp. Este é um valor real para privacidade, segurança e confiança.

Se você vai ter um assistente que sabe tudo sobre você—acho que quase todos nós teremos tal assistente—avançando 5 anos, todos terão um assistente que entende profundamente seus objetivos e tudo, e pode ajudá-lo a realizar as coisas. Nesta situação, ser líder do setor em privacidade e segurança é muito importante. Queríamos fazer isso desde o início.

Como moldar a personalidade da IA?

Host: Há outra coisa que é muito interessante—você estudou psicologia na universidade.

Mark: Bem, eu fiquei lá por um período muito curto, dois anos, mas sinto que isso influenciou muitas coisas que construí depois.

Apresentador: Quando olhamos para os modelos, costumamos dizer que um determinado modelo é "muito inteligente". Mas assim como escolhemos amigos, certamente é porque eles são inteligentes, e também porque gostamos da energia deles e da forma como nos relacionamos. Como você pensa sobre moldar a personalidade de um modelo?

Mark: Acho que o modelo ideal deve ser adaptável o suficiente para se ajustar aos estilos de diferentes pessoas. Acho que muitas pessoas na indústria erraram nisso — muitos outros laboratórios estão focados em "como projetar a personalidade corretamente", mas eu nunca pensei que a personalidade seja algo fixo. Essa é uma das razões pelas quais acredito tão fortemente no código aberto, acredito tão fortemente que as pessoas podem personalizar, e também é por isso que projetamos o Muse como um produto altamente pessoal.

Você pode personalizar e individualizar o Muse — não apenas a aparência e a voz. Quando você se inscreve pela primeira vez, a primeira coisa que ele pergunta é "como você quer que minha personalidade básica seja", e você pode mudá-la a qualquer momento.

Nós nos esforçamos para tornar o modelo altamente direcionável, para que você possa definir o tipo de interação que deseja. Essa é uma parte importante de torná-lo um excelente assistente pessoal — essa adaptabilidade em torno da personalidade é crucial.

Apresentador: Qual é o estilo do seu próprio Muse?

Mark: Eu o fiz direto e focado em eficiência. É bem interessante. Versões anteriores eram muito sarcásticas e bem-humoradas, mas a versão atual é mais direta. Meu assistente usa a aparência padrão do Muse, mas eu o vesti com uma toga e dei a ele uma voz profunda e um tanto cômica. Interagir com ele é divertido.

Apresentador: Acho que para ter senso de humor, você precisa ser realmente inteligente. Muitas pessoas não percebem que os comediantes estão entre as pessoas mais inteligentes da sociedade — reações rápidas, sagacidade suficiente. Você definitivamente tem esse traço. Assistindo a todas as suas entrevistas, você sempre se saiu bem.

As Previsões Inesperadas de Mark Sobre IA e o Metaverso

Apresentador: Na sua entrevista com Theo, você falou muito sobre a próxima fronteira da tecnologia e para onde tudo isso está finalmente caminhando. O campo da IA passou por vários "invernos", quando as pessoas pensavam que não haveria avanços. O metaverso também passou por vários desses períodos, quando todos pensavam que era uma aposta impossível de entregar. Eu experimentei o novo recurso de avatar holográfico ontem, é muito legal. Na entrevista com Lex, parecia que levaria 11 horas para gravar seu rosto, agora leva apenas 3 minutos. Como isso avançou até onde está hoje?

Mark: No desenvolvimento geral do metaverso, quando fundamos o Reality Labs, sempre acreditamos que eventualmente haveria óculos comuns de aparência normal, e com o tempo, eles poderiam tanto proporcionar presença imersiva quanto se tornar excelentes dispositivos de IA — porque os óculos são a única forma que permite a um dispositivo ver o que você vê, ouvir o que você ouve, se comunicar com você pelo seu ouvido o dia todo e, eventualmente, exibir imagens.

Mas 10 a 15 anos atrás, eu presumia que primeiro alcançaríamos a tecnologia holográfica, e depois a IA altamente desenvolvida. No entanto, o caminho da evolução tecnológica é interessante—na verdade, obtivemos a IA e a superinteligência pessoal primeiro, e depois a tecnologia para tornar a holografia amplamente difundida e acessível o suficiente. Isso é algo que eu não previ, mas fico feliz que estejamos trabalhando nas duas direções.

Nosso investimento significativo em óculos nos colocou em uma posição muito favorável quando os assistentes de IA estiverem prontos. Muitos dos anúncios no Connect foram precisamente sobre trazer o Muse e muitos recursos de IA para os óculos, e acho que os usuários vão gostar muito. Isso é um grande negócio.

Em relação à presença, ainda estamos avançando, mas o progresso é relativamente mais lento porque a maior parte da nossa energia mudou para construir o Muse e recursos de IA para os óculos. No entanto, temos um projeto de longa data sobre avatares de alta fidelidade em tempo real.

Como você disse, três ou quatro anos atrás, você precisava de uma sala de digitalização inteira para gravar uma pessoa de todos os ângulos, e então precisava de GPUs de nível empresarial para renderizar, o que era muito complicado. A demonstração que fizemos para o podcast Lex era esse tipo de configuração. Agora, basicamente, conseguimos fazê-lo funcionar em um par de óculos de VR—este é o primeiro formato de óculos que pode alcançar uma experiência de VR tão incrível, em vez de um grande headset. Apenas algumas fotos podem criar seu avatar, e o progresso é surpreendente.

Apresentador: E também pode conduzir expressões com base na voz. Na demonstração, me fez rir, me fez interagir, e então entendeu como meu rosto se move com a faixa de áudio. Você mencionou naquele podcast que algumas pessoas que geralmente são mais reservadas em suas expressões na verdade querem expressões mais ricas no mundo virtual. Como você vê as pessoas distinguindo entre seu "eu virtual" e seu "eu real"?

Mark: Acho que ainda estamos muito no início do entendimento da sociologia e psicologia disso. Acho que a percepção que as pessoas têm de si mesmas e a imagem que querem projetar são frequentemente um pouco diferentes de quem elas realmente são. Desde o nascimento das redes sociais, as pessoas vêm selecionando cuidadosamente avatares. Com os avatares do Muse, vimos um fenômeno semelhante. Não é tanto "curar" a si mesmo, mas "curar" a "pessoa" com quem você quer se comunicar.

Acho que quando você oferece às pessoas a capacidade de se expressarem, você quer que isso realmente as capture, e ao mesmo tempo é em si uma forma de expressão, não apenas um mero reflexo de espelho—é tanto comunicação quanto expressão. Esperamos construir algo que equilibre ambos. Este é sempre um ciclo iterativo: ver como as pessoas usam, depois melhorar. Após anos de trabalho, agora estamos verdadeiramente na linha de partida—pela primeira vez, podemos realmente colocar avatares realistas de alta qualidade em produtos, utilizáveis em telefones e em VR. Estou muito animado para ver os resultados.

Como será 2030?

Apresentador: Ok, me leve ao seu pensamento, avance rápido para 2030, se tudo correr bem, como será o lado da tecnologia holográfica? Hologramas mais Muse, mais óculos, como tudo isso se junta?

Mark: Minha compreensão da visão do metaverso sempre foi sobre efetivamente fundir o mundo físico com o mundo digital. A ideia básica é: temos este maravilhoso mundo físico e, ao mesmo tempo, também temos um maravilhoso mundo digital — a enorme quantidade de conteúdo acumulado na internet ao longo de 20 a 30 anos, que é de tirar o fôlego. Mas a forma como o acessamos é ou sentado em uma mesa ou através de uma pequena tela no bolso, o que é fundamentalmente muito limitado.

Acho que a versão mais ideal disso é uma fusão perfeita dos mundos físico e digital. Pense assim: agora nós dois estamos aqui. Em alguma versão futura, um de nós pode ser uma projeção holográfica, mas você ainda sente aquela sensação de que cada um está realmente presente, o que é completamente diferente de uma chamada de vídeo.

E o cerne da realidade virtual é precisamente entregar essa sensação de presença — fazendo você realmente sentir que está na mesma sala que os outros, ou em outro lugar. Você pode conseguir isso com tecnologia holográfica e misturá-la de várias maneiras. Por exemplo, posso jogar uma partida de pôquer com amigos, alguns dos quais estão presentes, e outros que se juntam através de avatares holográficos, e eles também podem jogar cartas, e a própria mesa de cartas também pode ser holográfica, para que aqueles que não estão presentes também possam ser integrados nisso.

Ao mesmo tempo, a IA também pode receber uma forma física e aparecer nessa cena. Em cenários de trabalho isso faz muito sentido — já estou usando vários agentes de codificação para construir coisas o tempo todo. Imagine isto: você tem um canal de bate-papo em grupo com várias pessoas e vários agentes, e você atribui tarefas aos agentes. Mas às vezes todos se reúnem para uma reunião, e os agentes talvez também devam estar presentes. Como eles aparecem? Simples, basta adicionar mais alguns assentos no sofá, e eles aparecem como avatares holográficos. Ou use aquele personagem fofo do Muse, ou um dragão, ou qualquer imagem estranha e esquisita que você criar.

Acho que isso vai parecer bastante natural no futuro.

Apresentador: Interessante. Em suas entrevistas anteriores você disse que a indústria de tecnologia frequentemente esquece a "diversão". Acho que ter um assistente físico aparecendo ali também faria com que parecesse mais real — como se o trabalho estivesse realmente sendo terceirizado. Quando você vê o Muse digitando, você sente que algo está realmente acontecendo. Isso é feito muito bem — poder ver o que está acontecendo no navegador. Então você acha que tal cenário é possível: você usa os óculos e então controla seu computador, deixando o Muse fazer coisas para você no computador?

Mark: Ah, com certeza. A VR já pode fazer isso. Você pode simplesmente encontrar um lugar para se sentar, um café serve, e então abrir sua estação de trabalho, com seis monitores, escrever código neles, tudo está lá.

No lado dos óculos, o modelo mais popular atualmente não tem display, o que, por um lado, o torna mais acessível e permite que mais pessoas o usem, e, por outro lado, ainda estamos trabalhando para encaixar um display na forma mais compacta. Mas já lançamos uma versão com display do Meta Ray-Ban, que é muito popular, e é um display pequeno. Também lançamos uma versão protótipo de AR holográfico de campo de visão completo, que acho que será muito empolgante.

Então toda a linha de produtos é assim: de óculos puramente de áudio — sem câmera, parecendo apenas óculos comuns, mas com o Muse dentro, permitindo que você use várias ferramentas de áudio, ouça música, faça chamadas — até versões mais avançadas, todas elas existem.

Apresentador: Estou me perguntando, com esses óculos de áudio, você pode falar com o Muse enquanto faz seu computador de casa fazer coisas?

Mark: Sim, com certeza. Acabamos de lançar esse recurso na conferência Connect.Agora todos os óculos estão conectados ao Meta AI, que é uma experiência de "turno único" — você envia um prompt, ele responde, e pronto. Mas com o Muse, basicamente vamos atualizar todos os óculos para o Muse. Primeiro, você não precisa mais dizer "Hey Meta", você pode dar qualquer nome a ele, o que já é parte da diversão. Depois você simplesmente fala com ele diretamente, e ele se conecta ao seu Muse, e seu Muse executa tarefas na sua máquina virtual segura, ajudando você a realizar as coisas.

Host: Isso é incrível!

Mentalidade de Fundador

Host: Ok, estamos aqui agora, o Muse está progredindo tranquilamente, e os óculos também estão indo bem, mas cerca de um ano atrás, muitas pessoas estavam perguntando "o que exatamente aconteceu com o laboratório de superinteligência". Naquele momento, como você se sentiu por dentro? Quando as coisas não estão indo bem, mas você ainda vê a visão de longo prazo, que tipo de experiência é essa?

Mark: O que realmente deu errado foi o projeto Llama e o Llama 4.

O Llama 1 foi um modelo bastante interessante, iniciou todo o movimento de IA de código aberto, e temos muito orgulho disso. O Llama 2 alcançou escala, o Llama 3 foi um bom modelo, quase na fronteira na época. Depois veio o Llama 4, e basicamente nos desviamos da trajetória que deveríamos seguir.

Sempre que as coisas não saem como eu espero, passo muito tempo pensando: por que isso aconteceu? O que precisamos mudar para fazer melhor? Desta vez, minha reflexão foi: eu errei toda a estrutura da equipe.

Eu modelei da forma como fazemos trabalhos de aprendizado de máquina como o feed do Instagram ou sistemas de anúncios — com centenas ou até milhares de pessoas trabalhando em paralelo em muitas coisas. Mas para construir modelos de linguagem, o que você realmente precisa é de uma equipe pequena extremamente unida, tratando isso como um projeto científico em grupo. Você não precisa de muitas pessoas, mas isso significa que cada assento na equipe é extremamente precioso.

Então reunimos as melhores pessoas de todo o Meta, e ao mesmo tempo trouxemos muitas pessoas brilhantes de toda a indústria, formando uma equipe totalmente nova — o Meta Superintelligence Labs.

Do meu ponto de vista, quando o MSL foi lançado, eu sabia que levaria algum tempo para reiniciar, reconstruir a infraestrutura e treinar a próxima geração de modelos. Mas eu sabia que tínhamos montado uma equipe excelente, e se a equipe pudesse se entrosar e operar bem, os resultados seriam bons.

Para mim, o momento mais emocionante, foi na verdade depois do lançamento do Llama 4 — eu pensei que estávamos no caminho certo, mas acabou que não estávamos. Essa foi uma surpresa negativa bastante grande. Eu acho que, como empreendedor, você é sempre testado nesses momentos, porque inevitavelmente, nem tudo vai correr bem. E o que realmente determina a trajetória é: quando as coisas não saem como você espera, como você encontra um caminho a seguir.

Host: Imagino que o inverso também seja verdade — quando algo supera em muito suas expectativas, como o lançamento do Muse, como você faz para garantir que consegue aproveitar essa oportunidade?

Mark: Exatamente. Agora a empresa inteira está totalmente envolvida—no começo era apenas uma pequena equipe construindo um produto, mas agora todos percebem que isso está realmente pronto para o grande palco. A empresa inteira está pensando em como tornar essa coisa grande, como fazer com que centenas de milhões de pessoas a experimentem.

Desde otimizar toda a infraestrutura para fazer tudo funcionar sem problemas e extrair cada bit de computação das GPUs existentes, até várias equipes de produto incorporando o Muse de diferentes maneiras—como em óculos. Ver todos trabalhando juntos para garantir que o Muse possa escalar sem problemas, essa sensação é ótima.

Como Mark escreve e comunica a visão

Host: Como fundador, sinto que esse é o momento que você mais anseia—tudo se encaixando. Como você comunica a visão para a empresa? Com tantas coisas sendo impulsionadas ao mesmo tempo, sinto que você escreve muito. Qual é o seu processo?

Mark: Escrever me ajuda muito, tanto para refinar meus próprios pensamentos quanto para me comunicar externamente. Neste verão, escrevi um texto muito longo chamado "O Futuro Pertence a Todos", cerca de 15 páginas, que me ajudou sistematicamente