作者:龙玥,华尔街见闻
三年前,Meta CEO扎克伯格在Joe Rogan节目上说过,有一天人们戴上眼镜、AI Agent就会随之出现。如今,这一幕或正在发生。
Meta推出的个人AI Agent——Muse上线两周用户即达数百万。扎克伯格在9月25日一档访谈节目中表示:“每隔几年我们才能遇到这种情况。”他将Muse的早期反响定性为“一出手就是全垒打”——这在Meta产品历史上属于少数。
与此同时,他宣布Muse将整合至全线Ray-Ban智能眼镜,用户无需再说“嘿Meta”,而是可以自定义唤醒词直接呼叫自己的个人AI Agent。
多年来被外界视为三场独立豪赌的元宇宙、智能眼镜和大模型,正在Meta内部产品层面加速合流。
在这场访谈中,扎克伯格还坦承了Llama 4失败是“最可怕的时刻”,并透露Meta正在建设5吉瓦级训练集群,认为足够大的算力可“暴力破解”AGI。
Muse 为何能“一出手就是全垒打”
Muse的起点,是扎克伯格和团队成员Nat与Alex坐在一起,用开源工具在家里“拼凑”出一个早期版本。
“我们意识到,这是一种神奇的体验,”扎克伯格说,“如果我们能把它做成任何人都可以用——不需要自己买Mac Mini、不需要在终端里折腾——那么这将是数十亿人想用的东西。”
这句判断,驱动了此后整套研发逻辑:不只是训练模型,而是从模型、脚手架、到Agent的“心跳”机制全栈自研——Agent会定期自动唤醒,检查用户目标,主动推进待办事项。
上线后的数据印证了这一判断。两周,数百万用户。
个人 AI:重点是执行、记忆与“判断力”
对于个人AI与通用AI的差别,扎克伯格将当前竞争焦点概括为让模型成为更好的Agent。
“过去一年最大的事情,基本上就是编程Agent。”他说,编程能力很重要,因为即使用户没有直接写代码,“你的Muse也会在后台一直为你写代码,去完成各种事情”。
但他认为,个人Agent不能只具备编码或任务执行能力,还需要理解隐私边界和社交语境。
扎克伯格举例称,用户让Muse预订餐厅时,Agent可能知道用户存在过敏情况或怀孕等信息,但并不意味着这些信息应该被自动披露。“你会希望它完成任务,同时尽可能少地披露信息。”
他称,这种能力属于人类通常具备的“基本社交技能或常识”,但如果只是训练编码Agent,许多公司并未将其纳入模型能力范围。
“我们训练的是整个模型,而不是拿别人的现成模型,再在外面搭一个框架和Agent。”扎克伯格说。Meta还在产品层面加入记忆、任务追踪、虚拟角色动画和实时语音互动等功能。
在个性化方面,他表示,Meta并不认为AI应该只有一种固定人格。“很多实验室都在关注怎样把人格调到正确状态,但我从来不认为人格只有一个正确答案。”
他称,Muse允许用户修改头像、声音和基础性格,模型设计目标是具备较高的可操控性。“你可以定义自己希望如何与它互动,这对个人Agent很重要。”
每个 Agent 都有自己的“电脑”
Muse区别于其他AI产品的核心基础设施之一,是Meta为每个Agent单独配备了一台安全虚拟机(Secure VM)。
扎克伯格解释了为什么这是必要的:
你的Agent会了解你很多敏感信息。我们不认为这些信息应该跟所有人的数据混在一个池子里。
他把Muse Secure VM比喻为“放在你桌子底下的那台只属于你的电脑”——用户数据加密存储,密码等敏感凭证通过独立安全模块管理,Agent本身无法直接读取。
在此基础上,Meta还设计了“Sentinel”安全Agent,专门监控进出Muse的数据流,一旦检测到异常或高风险操作,会直接拦截并提示用户授权。
元宇宙、智能眼镜与 Agent,三条路线正在汇合
扎克伯格在访谈中透露,Muse将全面接入Ray-Ban系列智能眼镜,并对现有交互方式做出升级。
目前的眼镜是“单轮对话”体验——说一句,得一个回复,结束。接入Muse之后,眼镜变成Agent的前端入口:用户开口,后端Muse在安全虚拟机里持续工作,完成任务再反馈。
对于眼镜的产品路线,他描述了一条清晰的硬件梯队:
- 无摄像头的纯音频眼镜:已搭载Muse,可处理通话、音乐、语音任务
- 带小显示屏的Meta Ray-Ban:已发布,具备基础视觉反馈
- 全视场角全息AR原型:已发布,扎克伯格称“会非常令人兴奋”
他称,Meta在眼镜上的长期投入,使公司在AI Agent成熟后处于较有利的位置。Meta正在将Muse及更多AI功能引入眼镜产品,而过去相对更强调“临场感”的元宇宙技术仍在继续推进,只是当前更多资源转向了Muse和智能眼镜的AI功能。
对于虚拟形象,扎克伯格称,Meta此前需要通过房间级设备、多角度扫描以及企业级GPU环境,生成较高质量的写实化身;目前,用户通过少量照片即可完成设置,相关能力已可运行于一副VR眼镜中。
展望2030年,扎克伯格称,元宇宙的核心愿景始终是融合物理世界和数字世界。他举例称,未来人们可以在线下与通过全息影像接入的朋友共同参与活动;在工作场景中,人类与多个Agent也可以共同参与群聊或会议,Agent可以以全息形象或其他具身化形式出现。
“最可怕的时刻”:Llama 4 的失误
并非所有押注都一帆风顺。扎克伯格在访谈中罕见地直接谈及了Llama 4的失败。
Llama 4之后,那是最可怕的时刻……我以为我们在正轨上,但我们没有。这是一个相当大的负面意外。
他把问题归结为团队结构的根本性错误:
我按照Instagram推荐系统或广告系统那种方式来组建团队——几百上千人并行推进。但训练语言模型需要的是一支紧密协作的小团队,把它当作一个群体科学项目来做。每个席位都极为宝贵。
由此,Meta彻底重组,从业内广泛引入顶尖人才,成立Meta超级智能实验室(Meta Super Intelligence Lab,MSL)。扎克伯格表示,新一代模型即将发布,但不会在Connect大会上公布。
算力路线:暴力破解 AGI,5 吉瓦项目在建
谈及通往AGI的技术路径,扎克伯格给出了一个直接的判断。
我不确定还需要什么根本性的架构突破……我认为我们已经大致知道配方了。如果你能建造一个足够大的超级计算机集群,就可以暴力破解,到达那里。
目前Meta的算力扩张路线:俄亥俄州超过1吉瓦的集群已基本投入使用,用于训练下一代模型;路易斯安那州5吉瓦级集群正在建设中。
他表示,“当你拥有多吉瓦集群进行训练时,你基本上就会得到某种接近AGI乃至超级智能的东西。”
不过他也补充,当前算力驱动路线并不意味着架构研究不重要——
人脑只消耗约10瓦,而我们的系统可能比它低效一百万倍。如果把大规模算力和架构突破结合起来,才能真正领先。
对齐,不是负担,是产品必须解决的问题
扎克伯格对AI安全的态度很务实——他不把它视为监管压力,而是产品能否成功的前提。
如果你让Muse做一件事,它却做了相反的事,谁还会用它?我们需要让模型不只是理解你的具体指令,还要理解你的意图和你的价值观。
“Muse要触达十亿用户,我们就必须解决对齐问题,或者说在这上面取得非常大的进展。”他说。
对于训练过程中的安全边界,他用了一个类比:“就像父母给孩子立规矩——如果它通过修改系统配置来’完成’一道编程题,我要告诉它:不,我让你去学解题方法,不是让你找捷径绕过去。”
访谈全文如下:
大举押注
主持人: 这件事将会有数十亿人想要使用。对您来说,做建设是一种怎样的感受?”永生”是一种可能吗?好,如果您带我进入您的思维,快进到2030年,那会是什么样子?
这位是马克·扎克伯格。22年前,他构建了一个连接数十亿人、永远改变了世界的社交网络。而如今,他决定建造更宏大的事物。为此,他正在元宇宙、智能眼镜和人工智能领域大举押注。多年来,怀疑者认为这是三场各自独立、不可能成功的赌注,但他们忽略了更宏观的图景——因为当下,这些押注正在汇聚,共同创造出一种全新的超级智能。
今天,我们将向大家呈现这一切,我也将向马克提出一些他从未被问过的问题,倾听他对未来的愿景,让您能够提前布局,构建下一件大事。
主持人: 非常感谢您来到节目。
马克: 谢谢,很高兴来这里。
主持人: 为了这次对话,我把您做过的每一次采访都看了一遍。
马克: 好家伙,那比我自己看的还多。
主持人: 很好玩,收获颇丰。有两件事给我留下了深刻印象:第一,您对”建造”的热爱,我感觉您就是最顶尖的建造者之一;第二,您押注的能力——敢于做出巨大的赌注。我觉得这周,所有这些押注正在汇聚到一起,所以我们就从这里说起吧。
马克: 好的。这些事情我们已经做了很长时间了。AI方面,作为一家公司,我们几乎从创立之初就在做了——第一版新闻资讯流在某种程度上就是一个机器学习产品。然后我们大约在15年前创建了AI研究实验室。
但现在我们进入了新阶段——大约一年多前,我们启动了Meta超级智能实验室。这是一次相当彻底的研究重启,从整个行业引进了大量优秀人才,令人振奋。目前,我们看到模型越来越好,下一代模型即将发布,不过不是在Connect大会上宣布。此外,我们还有Muse个人助理,目前来看反响非常好。
在构建这些东西的时候,你其实并不确定结果如何。我们自己是喜欢的。早在今年年初,我就在家里用自己的方式把Open Claw拼凑起来,感受这个东西是怎么运作的,以及怎样才能把它打造成一种任何人都能使用的神奇体验。
基本上,当我们——我、Nat和Alex——坐在一起,意识到这是一种神奇的体验,并且如果能把它打造成一个开箱即用的版本,让那些不懂技术、不想去自己安装Mac Mini、不想进终端折腾、也不想在出问题时调试的普通人也能用的时候,我就觉得,这将会是数十亿人都想要使用的东西。
从那以后,我们一直在围绕这个目标努力:专门为它调优模型,不仅构建了助理本身和运行框架,还构建了为每个助理提供独立计算环境的技术——我们为此构建了整套Muse安全虚拟机。
我们内部一直觉得这很特别,内部人员也很喜欢,但你永远不知道产品发布后大家会怎么反应。偶尔会出现一鸣惊人、开门红的情况,但大多数时候你会收到一些正面反馈,还需要迭代几个地方才能真正让产品”咔哒”一声落地。而这一次,它一出来就直接”咔哒”了。看到这一切发生真的非常令人振奋——才两周,使用人数就已经有数百万,这相当罕见。每隔几年我们才能遇到这样的情况,但这绝对是创业公司最令人享受的时刻之一。
主持人: 您能坚持在赛场上、不断尝试,这让我非常佩服。而且这么多次都打出了安打,真的很厉害。您之前有一次和乔·罗根的访谈,大概是三年前,最后您提到有一天可以直接戴上眼镜,AI助理也会随之出现。所以我感觉Muse已经有实体化的形象,这一点非常聪明,因为那感觉是必然会发生的事。
马克: 我觉得这也只是让它显得更友好可爱。我认为太多人把AI描述得像个令人恐惧的东西,但AI应该只是有用又有趣的。那个实体化的形象——项目早期有位设计师做出了那个角色,不知为何他们一直想迭代,但第一版就是最好的。后来有人说,”哦,它得是蓝色的,因为是Meta嘛。”我说,”不,我觉得这个形象就是对的,你第一次就钉住了。”就这样,就是好玩。
个人 AI 与通用 AI 有何不同?
主持人: 很好的细节。如果您想让模型在个人事务方面表现得非常出色,而不仅仅是通用智能模型,那么训练方式会有什么不同?
马克: 我认为目前的核心在于让模型成为优秀的”智能体(agent)”。过去一年,最大的风口是编程智能体,其中蕴含两个核心思想:编程专业能力,以及成为优秀智能体的通用能力。
我们的策略是,将智能体本身做好放在首位,而不是专攻编程能力。
编程能力之所以重要,是因为即使用户自己不认为在写代码,Muse也在后台一直为你写代码来完成各种任务。但我们认为,智能体应该首先是一个出色的智能体,编程能力服务于此目标。
此外,在构建个人助理时,有些事情比构建企业软件产品更为重要。比如,如果你在构建一个企业编程工具,模型根本不需要有任何关于”信息披露尺度”的概念——比如什么信息该说、什么不该说。但对于Muse来说,这非常重要。
你需要把这种能力训练进模型里,就像训练其他任何能力一样。你会告诉它很多事情,然后希望它去帮你实现目标。比如,你想让它帮你订餐厅,你在找一家合适的餐厅,但你可能有某种过敏症,或者你怀孕了,而你可能不想把这些透露给餐厅。但Muse会知道这些信息,你希望它在尽量少透露信息的同时完成任务。这是一种具体的技能,本质上是人类的基本社交常识。
但那些只做编程智能体的公司,大多数都没有把这种能力训练进去。我们之所以能做到,是因为我们在做全栈——我们不是从别人那里拿来一个现成的模型再套个框架,我们是从头训练整个模型,专门为这些能力服务。
模型当然需要具备广泛的通用智能,但它同时也具备这些特定能力。然后在此基础上,你构建整个助理,以及它周围所有的细节:记忆、运行框架,还有它”心跳”的方式——它定期唤醒,检查一下”好,这些是我了解的关于你的目标,有什么我现在可以推进的吗”。
我们还有一个专门的团队,只负责打磨虚拟形象的实时动画效果,因为不仅仅是默认形象——你可以自定义任何形象,然后它就自然地动起来,效果非常棒。我们还在推出语音模式,你可以进行实时语音对话,你的助理就在那里陪着你。这些细节,我觉得都源于我们在做全栈——模型和产品是一起开发的。
主持人: 另一件大事是虚拟机。能解释一下它为什么重要,以及它解锁了什么吗?
为什么 Meta 要为每个 AI 助理配备独立计算机?
马克: 基本上,一个智能体要能替你做事,就需要一个地方来存储你的信息。我们认为这些信息不应该和其他所有人的信息混在一个资源池里。
可以这样理解:你的助理会知道很多关于你的敏感信息。很多人最初接触OpenCloud这类智能体时,会在家里自己配一台Mac Mini。于是我们想,很多人并不想买Mac Mini或者自己设置。那么,什么样的体验能最好地近似这种效果呢?答案是:你只需下载一个App、注册,就能获得一台专属于你的计算机,供你的助理工作、存储数据,并围绕此建立安全模型。这样就近似于在你桌下有一台自己的电脑——就连我们Meta也无法访问。
比如Muse机密虚拟机,这是我们正在开发的功能,就连我们自己也无法看到你虚拟机里的内容。
我们还围绕这些构建了很多东西,比如安全凭证存储——当你的助理需要处理密码之类的信息时,它本身不需要能看到这些密码,只需要在你要求它登录某个服务时能”插入”凭证,并且只在你明确要求时才这样做。系统应该这样设计:那些信息本身就不可随意访问,因为意外总会发生,有人可能试图入侵,或者系统可能出现问题。
所以你要确保智能体无法访问这些数据,Meta也无法访问。为每个助理提供独立计算机,并把安全性做到极致,是这项技术的根本基础——既赋予Muse帮助用户实现目标所需的能力,也保证了隐私和安全,使其成为该领域世界级、行业领先的产品。
主持人: 那这是否意味着,就像WhatsApp一样,Muse连接到的虚拟机上的数据是加密的?人们该如何理解数据在虚拟机中的实际存储方式?
马克: 我们基本上构建了两个版本。Muse安全虚拟机(Secure VM)包含各种隐私功能,其中包括我们构建的整套Sentinel智能体架构。你有一个正在为你执行任务的普通Muse助理,同时还有一个我们称为Sentinel的安全智能体,专门监控进出你的Muse的数据流。
如果有外部内容试图破坏安全,Sentinel会直接切断,阻止其发生。如果它认为你的Muse即将采取某个需要你介入的行动,它会覆盖Muse的操作,并触发提醒,让人来确认权限——比如”你希望Muse能做这件事吗?”
这整套系统,加上安全凭证存储,再加上多层纵深防御,共同构成了Muse安全虚拟机。
我们还在开发另一个项目。Nat和我专门招募了Moxie Marlinspike——他就是当年和我们合作实现WhatsApp端对端加密的那个人——来设计Muse机密虚拟机(Confidential VM)。其核心思想是,在安全虚拟机的基础之上,再赋予你一个专属加密密钥,使得连Meta都无法访问其中的内容。
这个版本实现难度更大,因为如果Meta无法访问虚拟机内部,调试和保证系统正常运行就困难得多。所以我们花了一些时间,但很快就会推出。这基本上将达到人们在WhatsApp以及我们其他最安全产品上已经熟悉的安全标准。
主持人: 这样做的优势,只是让人们心理上觉得更安全,还是有实际的好处?
马克: 我认为安全本身就很重要。我们的目标是近似于让你在桌子下拥有一台本地机器。那台本地机器能给你什么?它意味着没有任何公司能访问它。
所以,假设Meta想为你提供这项服务,我们怎样才能给你同等级别的隐私和安全保障,使得没有任何公司——无论是Meta,还是任何试图入侵我们的人,或者在某些国家,你不信任当地政府的情况下——都无法访问它?因为我们自己也进不去,因为我们没有访问权限。
我认为这非常重要,这也是人们信任WhatsApp的重要原因。这对隐私、安全和信任来说是真实存在的价值。
如果你要拥有一个对你的一切了如指掌的助理——我猜几乎我们所有人都会拥有这样的助理——快进5年,每个人都会有一个能深入了解你的目标和一切的助理,并能帮你完成事情。在这种情况下,在隐私和安全方面做到行业领先就非常重要。我们从一开始就想这样做。
如何塑造 AI 的个性?
主持人: 您还有一点很有意思——您在大学学过心理学。
马克: 嗯,在那里只待了很短的时间,两年,但我感觉它影响了我后来构建的很多东西。
主持人: 我们看模型的时候,经常会说某个模型”非常聪明”。但就像我们选择朋友,肯定是因为他们聪明,同时也因为我们喜欢他们的能量和相处方式。您在塑造模型个性方面是怎么考虑的?
马克: 我认为理想的模型应该有足够的适应性,能够契合不同人的风格。我觉得很多行业人士在这一点上都搞错了方向——很多其他实验室都在专注于”如何把个性设计对”,但我从来不认为个性是一个固定的东西。这也是我如此坚信开源、如此坚信人们能够定制化的原因之一,也是我们把Muse设计成一个高度个人化产品的原因。
你可以自定义和个性化Muse——不只是形象和声音,在你第一次注册时,它问你的第一件事就是”你希望我的基本个性是什么样的”,而且你随时可以去修改。
我们努力让模型具有很强的可引导性,让你能定义自己想要的互动方式。这是让它成为优秀个人助理的重要组成部分——这种围绕个性的适应性非常关键。
主持人: 您自己的Muse是什么风格?
马克: 我让它直接、注重效率。它挺有意思的。早些时候的版本很爱讽刺、很幽默,但现在这个版本更直截了当。我的助理用的是默认的Muse形象,但我给他穿了一件托加长袍,还给他配了一个深沉到有些滑稽的嗓音,和他互动很有趣。
主持人: 我觉得要有幽默感,你必须真的很聪明。很多人没意识到,喜剧演员是社会上最聪明的一批人——反应要快,机智要够。您肯定有这个特质。看了您所有的采访,您一直表现很好。
马克关于 AI 与元宇宙的出人意料的预测
主持人: 您和Theo的访谈中,你们谈了很多关于技术的下一个前沿以及这一切最终指向何处。AI领域曾经历过几个”寒冬”,人们以为不会有突破。元宇宙也经历了几次这样的时期,大家觉得这是个无法兑现的赌注。我昨天试用了新的全息形象功能,非常酷。在和Lex的访谈里,感觉要花11个小时才能把您的脸录进去,现在只需要3分钟了。这是怎么推进到今天的?
马克: 在元宇宙的整体发展上,我们在创立Reality Labs时,始终认为最终会有外形正常的普通眼镜,并且随着时间推移,它既能提供沉浸式的临场感,又能成为出色的AI设备——因为眼镜是唯一能让设备看到你所看、听到你所听的形态,整天在你耳边与你交流,并最终显示图像。
但10到15年前,我当时假设我们会先实现全息技术,再有高度发达的AI。然而技术演进的路径很有趣——我们实际上先有了AI和个人超级智能,然后才有技术来让全息技术变得足够普及和实惠。这是我没有预料到的,但我很高兴我们两个方向都在做。
我们在眼镜上的大量投入,让我们在AI助理准备就绪之际,处于了非常有利的位置。Connect大会上的很多发布,正是关于把Muse和大量AI功能引入眼镜,我认为用户会非常喜欢。这是个大事。
关于临场感方面,我们仍在推进,但进度相对慢一些,因为我们大部分精力已经转向为眼镜构建Muse和AI功能。不过,我们有一个持续已久的项目,就是实时高保真的虚拟化身。
就像您说的,三四年前,你需要一整个扫描室从各个角度录入一个人,然后还需要企业级GPU才能渲染,非常费事。我们为Lex播客做的那个演示就是那种设置。而现在我们基本上让它在一副VR眼镜里就能运行——这是第一副能实现这种惊人VR体验的眼镜形态,而不是一个大头显。只需几张照片就能建立你的虚拟化身,进展之快令人惊叹。
主持人: 而且还能基于声音来驱动表情。在演示里,它让我笑,让我互动,然后理解我的面部如何随着音轨运动。您在那期播客里提到,一些平时表情比较内敛的人,实际上在虚拟世界里会想要更丰富的表情。您怎么看待人们区分”虚拟自我”和”现实自我”这件事?
马克: 我认为我们在理解这方面的社会学和心理学上还处于很早期的阶段。我觉得人们对自己的认知和想要投射出去的形象,往往和实际的自己有些不同。从社交网络诞生之初,人们就在精心挑选头像。在Muse的虚拟形象上,我们也看到了类似的现象。那不太是在”策展”自己,而是在”策展”你想要与之交流的那个”人”。
我认为,当你在给人们提供表达自我的能力时,你既希望它能真实捕捉到他们,同时它本身也是一种表达形式,而不只是纯粹的镜像映射——它既是传达,也是表达。我们希望能构建出兼顾两者的东西。这始终是一个迭代循环:看看人们怎么用,然后改进。经过多年工作,我们现在才真正站在了起跑线上——第一次能将相当高质量的写实化身真正做进产品里,在手机上可以用,在VR里也可以用。我非常期待看到结果。
2030 年会是什么样子?
主持人: 好,带我进入您的思维,快进到2030年,如果一切顺利,全息技术那边会是什么样子?全息加Muse,加上眼镜,它们如何汇聚在一起?
马克: 我对元宇宙愿景的理解,始终是关于将物理世界与数字世界有效融合。基本理念是:我们有这个美好的物理世界,同时也有一个精彩的数字世界——互联网上20到30年来积累的海量内容,令人叹为观止。但我们访问它的方式,要么是坐在桌前,要么是通过口袋里的一块小屏幕,这从根本上看非常受限。
我认为这件事最理想的版本,就是物理与数字世界的无缝融合。可以这样想:现在我们两个人在这里。未来的某个版本里,我们其中一个人可能是一个全息投影,但你依然感受到彼此真实在场的那种感觉,这和视频通话完全不同。
而虚拟现实的核心,正是传递这种临场感——让你真切感受到自己与他人同处一室,或置身于另一个地方。你可以用全息技术实现这一点,并以各种方式混合。比如,我可以和朋友打一场扑克,一部分人在场,另一部分人通过全息形象加入,也能打牌,牌桌本身也可以是全息的,这样不在场的人也能融入其中。
与此同时,AI也可以被赋予实体,出现在这个场景里。在工作场景中这很有意义——我现在就一直在用各种编程智能体来构建东西。试想一下:你有一个群聊频道,里面有几个人和几个智能体,你给智能体分配任务。但有时候,大家会聚在一起开会,智能体也许也应该在场。它们怎么出现?很简单,沙发上多几个位置,它们以全息形象出现就好。或者用Muse那个可爱的小角色,或者是龙,或者是任何你创造的奇奇怪怪的形象。
我猜这在未来会感觉相当自然。
主持人: 有意思。您之前的采访中说过,科技行业经常忘记”好玩”这件事。我觉得有个实体助理出现在那里,也会让感觉更真实——就好像真的把工作外包出去了。当你看到Muse在打字,就感觉有什么事情真的在发生。这一点做得很好——能看到浏览器里正在发生什么。那么您认为有没有可能出现这样的场景:你戴着眼镜,然后控制你的电脑,让Muse在电脑上帮你做事?
马克: 哦,肯定的。VR已经可以做到了。你可以随便找个地方坐下,咖啡馆也行,然后打开你的工作站,有六个显示器,在上面写代码,一切都有。
眼镜这边,最受欢迎的那款目前还没有显示器,这样一方面可以让价格更实惠,让更多人使用,另一方面我们仍在努力让显示器做进最紧凑的形态里。但我们已经发布了Meta Ray-Ban的显示器版本,很受欢迎,是一块小显示器。我们还发布了全视场全息AR的原型版本,我认为会非常令人兴奋。
所以,整条产品线就是这样的:从纯音频眼镜——没有摄像头,看起来就是普通眼镜,但里面有Muse,可以用各种音频工具、听音乐、打电话——到更高阶的版本,全都有。
主持人: 我在想,戴着那款音频眼镜,能不能一边跟Muse说话,一边让家里的电脑在做事?
马克: 对,完全可以。我们刚刚在Connect大会上发布了这个功能。现在所有眼镜都连接到Meta AI,是一种”单轮”体验——你发一个提示,它回复,就这样。但有了Muse,我们基本上要把所有眼镜都升级为Muse。首先,你不需要再说”Hey Meta”了,你可以给它取任何名字,这本身就是乐趣的一部分。然后你就直接和它说话,它连接到你的Muse,你的Muse在你的安全虚拟机里处理任务,帮你把事情搞定。
主持人: 太厉害了!
创始人心态
主持人: 好,我们现在在这里,Muse进展很顺利,眼镜也做得不错,但大约一年前,很多人都在问”超级智能实验室到底怎么了”。在那个时刻,您内心是什么感受?当事情进展不顺、但您又看到了长期愿景,那是一种怎样的体验?
马克: 真正出了问题的是Llama项目和Llama 4。
Llama 1是一个相当有趣的模型,它开创了整个开源AI运动,我们对此非常自豪。Llama 2实现了规模化,Llama 3是一个很好的模型,在当时几乎达到了前沿水平。然后到了Llama 4,我们基本上偏离了应有的发展轨迹。
每当事情没有按我预期的方向发展,我都会花大量时间思考:为什么会这样?我们需要改变什么才能做得更好?这次,我的反思是:整个团队的架构我搞错了。
我把它建模成了我们做Instagram信息流或广告系统这类机器学习工作的方式——有数百甚至上千人并行工作在很多事情上。但对于构建语言模型来说,你真正需要的是一个极其紧密的小团队,把它当成一个团体科学项目来做。人不需要多,但这意味着团队里的每一个席位都极其宝贵。
于是我们从Meta各处网罗了最优秀的人,同时从行业各地引进了很多牛人,组建了一个全新的团队——就是Meta超级智能实验室。
从我的角度来看,在MSL启动之时,我就知道这需要一段时间来重启、重建基础设施、训练下一代模型。但我知道我们拼起了一支出色的队伍,如果团队能磨合好、运转良好,结果就会很好。
对我来说,最惊心动魄的时刻,其实是Llama 4发布后——我以为我们在这条轨道上,结果发现并没有。那是一个相当大的负面意外。我想,作为创业者,你总会在这些时刻被考验,因为不可避免地,并非所有事情都会一帆风顺。而真正决定发展轨迹的,是:当事情没有按你希望的方向发展时,你如何找到前进的方法。
主持人: 我猜反过来也是如此——当某件事远超你的预期时,比如Muse的首发,你如何确保能把握住这个机会?
马克: 完全是这样。现在公司全员投入——最开始只是一个构建产品的小团队,但现在大家都意识到,这真的准备好了登上大舞台。全公司都在想,怎么把这个东西做大,怎么让数亿人都能体验到。
从优化所有基础设施让一切顺畅运行、榨干现有GPU的每一分算力,到各个产品团队以不同方式将Muse嵌入——比如眼镜。看到大家齐心协力,确保Muse能顺利扩展出去,这种感觉非常棒。








