Цукерберг про Muse: бум AI-агентів, перетин «метавсесвіту, розумних окулярів і великих моделей»

ШІ-агентLlama 4MetaMuseрозумні окуляриAGIметавсесвіт
1 годину томуДжерело: blockweeks.com
Цукерберг про Muse: бум AI-агентів, перетин «метавсесвіту, розумних окулярів і великих моделей»

Автор: Long Yue, Wallstreetcn

Три роки тому генеральний директор Meta Цукерберг сказав у шоу Джо Рогана, що одного дня, коли люди одягнуть окуляри, з ними з'явиться ШІ-агент. Тепер ця сцена, можливо, відбувається.

Персональний ШІ-агент Meta, Muse, досяг мільйонів користувачів протягом двох тижнів після запуску. Цукерберг сказав в інтерв'ю 25 вересня: «Кожні кілька років ми отримуємо щось подібне». Він охарактеризував ранній прийом Muse як «хоум-ран з першого замаху» — що рідкість в історії продуктів Meta.

Водночас він оголосив, що Muse буде інтегровано в усю лінійку розумних окулярів Ray-Ban, і користувачам більше не потрібно буде казати «Hey Meta», а можна налаштувати власне слово-активатор, щоб безпосередньо викликати свого персонального ШІ-агента.

Протягом багатьох років метавсесвіт, розумні окуляри та великі моделі, які зовнішній світ розглядав як три незалежні ставки, прискорюють свою конвергенцію на внутрішньому продуктовому рівні Meta.

У цьому інтерв'ю Цукерберг також визнав, що провал Llama 4 був «найстрашнішим моментом», і розкрив, що Meta будує тренувальний кластер потужністю 5 гігават, вважаючи, що достатньо великі обчислення можуть «грубою силою» досягти AGI.

Цукерберг розповідає про Muse: ШІ-агент вибухає, 'метавсесвіт, розумні окуляри та великі моделі' три основні ставки завершують свою конвергенцію

Чому Muse може бути «хоум-раном з першого замаху»

Відправною точкою Muse було те, що Цукерберг сів разом із членами команди Натом і Алексом, використовуючи інструменти з відкритим кодом, щоб «зібрати докупи» ранню версію вдома.

«Ми зрозуміли, що це магічний досвід», — сказав Цукерберг, «якби ми могли зробити його чимось, що може використовувати будь-хто — без необхідності купувати Mac Mini самостійно, без необхідності возитися в терміналі — тоді це було б чимось, що захотіли б використовувати мільярди людей».

Це судження визначило всю подальшу логіку досліджень і розробок: не просто тренування моделей, а повностекова самостійна розробка від моделі, каркасу до механізму «серцебиття» агента — агент автоматично прокидатиметься періодично, перевірятиме цілі користувача та проактивно просуватиме справи.

Дані після запуску підтвердили це судження. Два тижні, мільйони користувачів.

Персональний ШІ: фокус на виконанні, пам'яті та «судженні»

Щодо різниці між персональним ШІ та загальним ШІ, Цукерберг узагальнив поточний фокус конкуренції як створення моделей, які є кращими агентами.

«Найбільше за минулий рік — це, по суті, агенти для кодування». Він сказав, що здатність до кодування важлива, оскільки навіть якщо користувачі не пишуть код безпосередньо, «ваша Муза також постійно писатиме код для вас у фоновому режимі, щоб виконувати різні речі».

Але він вважає, що персональний агент не може мати лише здатність до кодування або виконання завдань; він також повинен розуміти межі приватності та соціальний контекст.

Цукерберг навів приклад: коли користувач просить Музу забронювати ресторан, агент може знати таку інформацію, як алергії користувача або вагітність, але це не означає, що цю інформацію слід автоматично розкривати. «Ви хочете, щоб він виконав завдання, розкриваючи якомога менше інформації».

Він сказав, що ця здатність належить до «базових соціальних навичок або здорового глузду», які зазвичай притаманні людям, але якщо компанії тренують лише агентів для кодування, багато з них не включили це до сфери можливостей моделі.

«Ми тренуємо всю модель, а не беремо чиюсь готову модель і будуємо навколо неї фреймворк та агента», — сказав Цукерберг.Meta також додала на рівні продукту такі функції, як пам'ять, відстеження завдань, анімація віртуальних персонажів та взаємодія в реальному часі голосом.

Щодо персоналізації, він сказав, що Meta не вірить, що ШІ повинен мати лише одну фіксовану особистість. «Багато лабораторій зосереджені на тому, як налаштувати особистість до правильного стану, але я ніколи не вірив, що існує лише одна правильна відповідь для особистості».

Він сказав, що Муза дозволяє користувачам змінювати аватар, голос і базову особистість, а модель розроблена так, щоб бути висококерованою. «Ви можете визначити, як ви хочете з нею взаємодіяти, що дуже важливо для персонального агента».

Кожен агент має свій власний «комп'ютер»

Однією з основних інфраструктурних відмінностей Музи від інших ШІ-продуктів є те, що Meta оснащує кожного агента власною захищеною віртуальною машиною.

Цукерберг пояснив, чому це необхідно:

Ваш Агент знатиме багато конфіденційної інформації про вас. Ми не вважаємо, що ця інформація повинна змішуватися в один спільний пул із даними всіх інших.

Він порівняв Muse Secure VM із «тим комп'ютером під вашим столом, який належить лише вам» — дані користувача зберігаються в зашифрованому вигляді, а конфіденційні облікові дані, як-от паролі, керуються через незалежний модуль безпеки, який сам Агент не може безпосередньо прочитати.

На цій основі Meta також розробила безпекового Агента «Sentinel» спеціально для моніторингу потоків даних, що надходять до Muse та виходять із нього. Щойно виявляються аномалії або високоризикові операції, він одразу їх перехоплює та запитує в користувача авторизацію.

Метавсесвіт, розумні окуляри та Агенти: три шляхи зближуються

В інтерв'ю Цукерберг розкрив, що Muse буде повністю інтегровано в серію розумних окулярів Ray-Ban і що це оновить наявний спосіб взаємодії.

Поточні окуляри пропонують досвід «одноходової розмови» — скажіть одну річ, отримайте одну відповідь, і на цьому все. Після інтеграції Muse, окуляри стають фронтальним вхідним пунктом для Агента: користувач говорить, а бекенд Muse продовжує працювати в Secure VM, а потім звітує, коли завдання виконано.

Щодо дорожньої карти продукту для окулярів він описав чітку апаратну драбину:

  • Окуляри без камери, лише з аудіо: вже оснащені Muse, можуть виконувати дзвінки, музику та голосові завдання
  • Meta Ray-Ban із невеликим дисплеєм: уже випущені, з базовим візуальним зворотним зв'язком
  • Голографічний AR-прототип із повним полем зору: уже випущений, який Цукерберг назвав «дуже захопливим»

Він сказав, що довгострокові інвестиції Meta в окуляри ставлять компанію у відносно вигідне становище, коли AI-агенти дозріють.Meta впроваджує Muse та більше AI-функцій у свої продукти-окуляри, тоді як технологія метавсесвіту, яка раніше наголошувала на більшому відчутті «присутності», все ще розвивається, хоча зараз більше ресурсів переміщується до Muse та AI-функцій розумних окулярів.

Щодо віртуальних аватарів Цукерберг сказав, що раніше Meta потребувала пристроїв масштабу кімнати, багатокутового сканування та середовищ GPU корпоративного рівня, щоб генерувати відносно якісні реалістичні аватари; тепер користувачі можуть завершити налаштування лише за допомогою кількох фотографій, і відповідна можливість уже може працювати в парі VR-окулярів.

Заглядаючи в 2030 рік, Цукерберг сказав, що основне бачення метавсесвіту завжди полягало в інтеграції фізичного світу та цифрового світу. Наприклад, сказав він, у майбутньому люди зможуть разом брати участь у заходах офлайн із друзями, які приєднуються через голографічні зображення; у робочих сценаріях люди та кілька Агентів також зможуть разом брати участь у групових чатах або зустрічах, і Агенти можуть з'являтися як голографічні фігури або в інших втілених формах.

«Найстрашніший момент»: помилка Llama 4

Не всі ставки зіграли гладко. В інтерв'ю Цукерберг рідко говорив прямо про невдачу Llama 4.

Після Llama 4 це був найстрашніший момент... Я думав, що ми на правильному шляху, але це було не так. Це була досить велика негативна несподіванка.

Він приписав проблему фундаментальній помилці в структурі команди:

Я побудував команду за принципом системи рекомендацій Instagram або рекламної системи — сотні чи тисячі людей працюють паралельно. Але навчання мовної моделі вимагає тісно співпрацюючої невеликої команди, яка працює як груповий науковий проєкт. Кожне місце надзвичайно цінне.

У результаті Meta повністю реорганізувалася, широко залучивши найкращі таланти з усієї галузі, і заснувала Meta Super Intelligence Lab (MSL). Цукерберг сказав, що нове покоління моделей буде випущено незабаром, але це не буде оголошено на конференції Connect.

Обчислювальний шлях: груба сила для AGI, проєкт потужністю 5 гігаватів у процесі будівництва

Говорячи про технічний шлях до AGI, Цукерберг дав пряму оцінку.

Я не впевнений, який фундаментальний архітектурний прорив ще потрібен... Я думаю, ми вже приблизно знаємо рецепт. Якщо ви можете побудувати достатньо великий кластер суперкомп'ютерів, ви можете досягти цього грубою силою.

Поточний шлях розширення обчислень Meta: кластер потужністю понад 1 гігават в Огайо в основному вже використовується для навчання наступного покоління моделей; кластер класу 5 гігаватів у Луїзіані будується.

Він сказав: «Коли у вас є багатогігаватні кластери для навчання, ви basically отримаєте щось близьке до AGI або навіть надінтелекту».

Однак він також додав, що поточний шлях, керований обчисленнями, не означає, що архітектурні дослідження неважливі —

Людський мозок споживає лише близько 10 ват, тоді як наші системи можуть бути в мільйон разів менш ефективними за нього. Лише поєднуючи масштабні обчислювальні потужності та архітектурні прориви, ми зможемо справді вести за собою.

Узгодження — це не тягар, а проблема, яку продукт має вирішити

Ставлення Цукерберга до безпеки ШІ є дуже прагматичним — він не розглядає її як регуляторний тиск, а як передумову того, чи зможе продукт досягти успіху.

Якщо ви попросите Muse зробити одну річ, а він зробить протилежне, хто ще ним користуватиметься? Нам потрібно зробити так, щоб модель не лише розуміла ваші конкретні інструкції, а й розуміла ваш намір і ваші цінності.

«Щоб Muse досяг мільярда користувачів, ми повинні вирішити проблему узгодження, або принаймні досягти дуже великого прогресу в ній», — сказав він.

Щодо меж безпеки під час процесу навчання він використав аналогію: «Це як батьки, які встановлюють правила для своїх дітей — якщо він «виконує» завдання з програмування, змінюючи системні конфігурації, я хочу сказати йому: Ні, я просив тебе вивчити метод розв'язання задачі, а не знайти короткий шлях, щоб обійти його».

Цукерберг розповідає про Muse: ШІ-агент вибухає, «Метавсесвіт, розумні окуляри та великі моделі» — три головні ставки завершують своє перетинання

Повне інтерв'ю виглядає так:

Роблячи великі ставки

Ведучий: Мільярди людей захочуть цим користуватися. Як для вас — яке це відчуття, будувати це? Чи є «безсмертя» можливістю? Гаразд, якщо ви візьмете мене у свій розум і перемотаєте до 2030 року, як це виглядатиме?

Це Марк Цукерберг. Двадцять два роки тому він створив соціальну мережу, яка з'єднала мільярди людей і назавжди змінила світ. А тепер він вирішив створити щось ще більше. Для цього він робить великі ставки на метавсесвіт, розумні окуляри та штучний інтелект. Роками скептики вважали, що це три окремі, неможливі ставки, але вони пропустили ширшу картину — бо прямо зараз ці ставки сходяться, щоб спільно створити абсолютно новий вид надінтелекту.

Сьогодні ми представимо все це всім, а я також поставлю Марку кілька запитань, які йому ніколи не ставили, послухаю його бачення майбутнього, щоб ви могли планувати заздалегідь і створити наступну велику річ.

Ведучий: Дуже дякую, що прийшли на шоу.

Марк: Дякую, я радий бути тут.

Ведучий: Для цієї розмови я передивився кожне інтерв'ю, яке ви коли-небудь давали.

Марк: Ого, це більше, ніж я сам передивився.

Ведучий: Це було весело і дуже корисно. Дві речі справили на мене глибоке враження: по-перше, ваша любов до «створення» — я відчуваю, що ви один із найкращих творців; по-друге, ваша здатність робити ставки — сміливість робити величезні ставки. Я думаю, цього тижня всі ці ставки сходяться, тож почнімо з цього.

Марк: Гаразд. Ми займаємося цими речами вже давно. Щодо ШІ, як компанія, ми займаємося цим майже від самого початку — перша версія стрічки новин, певною мірою, була продуктом машинного навчання. Потім ми створили дослідницьку лабораторію ШІ близько 15 років тому.

Але тепер ми ввійшли в нову фазу — приблизно рік тому ми запустили Meta Superintelligence Labs. Це був досить ґрунтовний перезапуск досліджень, який залучив багато чудових талантів з усієї галузі, що захоплює. Наразі ми бачимо, що моделі стають дедалі кращими, і наступне покоління моделей ось-ось вийде, хоча його не анонсують на Connect. Крім того, у нас є персональний асистент Muse, який поки що дуже добре сприймається.

Коли створюєш такі речі, насправді не знаєш, як воно вийде. Нам самим це подобається. Раніше цього року я зібрав Open Claw вдома по-своєму, щоб відчути, як ця штука працює і як перетворити її на магічний досвід, яким зможе скористатися будь-хто.

По суті, коли ми — я, Нат і Алекс — сиділи разом і усвідомили, що це магічний досвід, і що якби ми могли перетворити його на версію «з коробки», яку могли б використовувати й звичайні люди, які не розбираються в технологіях, не хочуть самі встановлювати Mac Mini, не хочуть вовтузитися в терміналі й не хочуть налагоджувати, коли щось іде не так, я відчув, що це буде те, чим захочуть користуватися мільярди людей.

Відтоді ми працювали над цією метою: налаштовували моделі спеціально для цього, створювали не лише самого асистента та середовище виконання, а й технологію, яка забезпечує кожному асистенту незалежне обчислювальне середовище — для цього ми створили всю захищену віртуальну машину Muse.

Внутрішньо ми завжди вважали, що це особливо, і внутрішня команда це любила, але ніколи не знаєш, як люди відреагують після запуску продукту. Іноді трапляються випадки, коли він одразу вибиває хоум-ран, але здебільшого отримуєш трохи позитивних відгуків і потрібно доопрацювати кілька речей, перш ніж продукт справді «заклацає». А цього разу він «заклацав» одразу. Дуже захоплююче бачити, як це відбувається — лише за два тижні ним уже користуються мільйони людей, що досить рідко. Ми стикаємося з такою ситуацією лише раз на кілька років, але це, безумовно, один із найприємніших моментів для стартапу.

Ведучий: Я справді захоплююся вашою здатністю залишатися в грі та продовжувати спроби. І те, що ви так багато разів вибивали хоум-ран, справді вражає. У попередньому інтерв'ю з Джо Роґаном, близько трьох років тому, ви наприкінці згадали, що одного дня можна буде просто одягнути окуляри, і з'явиться AI-асистент. Тож я відчуваю, що Muse вже має фізичну форму, що дуже розумно, бо це здається неминучим.

Марк: Я думаю, це також просто робить його дружнішим і милішим. Я вважаю, що занадто багато людей описують ШІ як щось жахливе, але ШІ має бути просто корисним і цікавим. Ця фізична форма — на ранньому етапі проєкту дизайнер створив цього персонажа, і чомусь вони весь час хотіли його переробляти, але перша версія була найкращою. Пізніше хтось сказав: «О, він має бути синім, бо це Meta». Я сказав: «Ні, я думаю, ця форма правильна, ви влучили з першого разу». І все, це просто цікаво.

Чим персональний ШІ відрізняється від загального ШІ?

Ведучий: Чудова деталь. Якщо ви хочете, щоб модель досягла успіху в особистих справах, а не лише як модель загального інтелекту, чим відрізнявся б підхід до навчання?

Марк: Я думаю, що зараз основа — це зробити модель чудовим «агентом». За минулий рік найбільшим трендом стали агенти для кодування, які містять дві ключові ідеї: експертизу в кодуванні та загальну здатність бути чудовим агентом.

Наша стратегія — насамперед зробити самого агента чудовим, а не спеціалізуватися на здатності до кодування.

Здатність до кодування важлива, бо навіть якщо користувачі не думають, що пишуть код, Muse завжди пише код у фоновому режимі для виконання різних завдань. Але ми вважаємо, що агент насамперед має бути чудовим агентом, а здатність до кодування слугує цій меті.

Більше того, під час створення персонального асистента деякі речі важливіші, ніж під час створення корпоративних програмних продуктів. Наприклад, якщо ви створюєте корпоративний інструмент для кодування, модель не повинна мати жодного поняття про «межі розкриття інформації» — наприклад, яку інформацію слід сказати, а яку ні. Але для Muse це дуже важливо.

Потрібно навчити цій здатності модель, так само як і будь-якій іншій здатності. Ви розповідаєте їй багато речей, а потім хочете, щоб вона допомогла вам досягти ваших цілей. Наприклад, ви хочете, щоб вона допомогла вам забронювати ресторан, ви шукаєте відповідний ресторан, але у вас може бути алергія, або ви вагітні, і ви можете не хотіти розкривати це ресторану. Але Muse знатиме цю інформацію, і ви хочете, щоб вона виконала завдання, розкривши якомога менше інформації. Це конкретна навичка, по суті базовий людський соціальний здоровий глузд.

Але більшість компаній, які займаються лише агентами для кодування, не навчили цій здатності свої моделі. Ми можемо це робити, бо ми працюємо за повним стеком — ми не беремо чиюсь готову модель і не накладаємо на неї фреймворк; ми навчаємо всю модель з нуля, спеціально для цих здатностей.

Модель, звісно, потребує широкого загального інтелекту, але вона також має ці специфічні здібності. А потім поверх цього ви будуєте всього асистента та всі деталі навколо нього: пам'ять, середовище виконання та спосіб його «серцебиття» — він періодично прокидається й перевіряє: «Гаразд, ось цілі, які я знаю про вас, чи є щось, що я можу просунути прямо зараз?»

У нас також є окрема команда, яка займається виключно вдосконаленням анімаційних ефектів аватара в реальному часі, бо це не просто аватар за замовчуванням — ви можете налаштувати будь-який аватар, і тоді він рухається природно, а ефект фантастичний. Ми також запускаємо голосовий режим, де ви можете вести розмови голосом у реальному часі, і ваш асистент поруч із вами. Ці деталі, я думаю, всі походять від того, що ми робимо повний стек — модель і продукт розробляються разом.

Ведучий: Ще одна велика річ — це віртуальна машина. Чи можете ви пояснити, чому вона важлива і що вона відкриває?

Чому Meta дає кожному AI-асистенту власний комп'ютер?

Марк: По суті, щоб агент міг щось робити для вас, йому потрібне місце для зберігання вашої інформації. Ми вважаємо, що ця інформація не повинна змішуватися з інформацією всіх інших у спільному пулі ресурсів.

Подумайте про це так: ваш асистент знатиме багато конфіденційної інформації про вас. Багато людей спочатку стикаються з агентами, як-от OpenCloud, налаштовуючи Mac Mini вдома. Тож ми подумали: багато людей не хочуть купувати Mac Mini або налаштовувати його самостійно. Тож який досвід найкраще наблизився б до цього ефекту? Відповідь: ви просто завантажуєте застосунок, реєструєтеся й отримуєте комп'ютер, призначений лише для вас, щоб ваш асистент працював і зберігав дані, а навколо цього будується модель безпеки. Це наближає до наявності власного комп'ютера під вашим столом — навіть ми в Meta не можемо отримати до нього доступ.

Наприклад, конфіденційні віртуальні машини Muse — це функція, яку ми розробляємо, і навіть ми самі не можемо бачити вміст вашої віртуальної машини.

Ми також побудували багато речей навколо цього, як-от безпечне зберігання облікових даних — коли вашому асистенту потрібно обробляти інформацію, як-от паролі, він сам не повинен мати можливості бачити ці паролі; йому потрібно лише мати можливість «вставити» облікові дані, коли ви просите його ввійти в певний сервіс, і робити це лише тоді, коли ви явно просите. Система має бути спроєктована саме так: ця інформація сама по собі не повинна бути вільно доступною, бо нещасні випадки трапляються завжди, хтось може спробувати зламати систему, або в системі можуть виникнути проблеми.

Тож вам потрібно забезпечити, щоб агент не міг отримати доступ до цих даних, і Meta також не могла отримати до них доступ. Надання кожному асистенту незалежного комп'ютера та максимально екстремальна безпека — це фундаментальна основа цієї технології: вона і дає Muse можливості, потрібні для допомоги користувачам у досягненні їхніх цілей, і забезпечує приватність і безпеку, роблячи його продуктом світового рівня, провідним у галузі в цій сфері.

Ведучий: Тож чи означає це, що, як і у WhatsApp, дані на віртуальній машині, до якої підключається Muse, зашифровані? Як люди повинні розуміти, як насправді зберігаються дані у віртуальній машині?

Марк: Ми фактично створили дві версії. Muse Secure VM включає різноманітні функції конфіденційності, зокрема всю архітектуру агента Sentinel, яку ми побудували. У вас є звичайний асистент Muse, який виконує завдання для вас, і водночас є також агент безпеки, який ми називаємо Sentinel, який спеціально відстежує потік даних, що надходять до вашого Muse та виходять з нього.

Якщо зовнішній вміст спробує порушити безпеку, Sentinel негайно його відсіче та не дасть цьому статися. Якщо він вважатиме, що ваш Muse збирається виконати дію, яка потребує вашого втручання, він перекриє роботу Muse та ініціює сповіщення для підтвердження дозволу людиною — наприклад, «Чи хочете ви, щоб Muse міг це зробити?»

Уся ця система, плюс безпечне зберігання облікових даних, плюс кілька рівнів глибокого захисту — разом усе це складає Muse Secure VM.

Ми також розробляємо ще один проєкт. Ми з Нетом спеціально залучили Моксі Марлінспайка — саме ту людину, яка разом з нами свого часу впроваджувала наскрізне шифрування у WhatsApp — щоб спроєктувати Muse Confidential VM. Основна ідея полягає в тому, що поверх безпечної віртуальної машини вам також надається спеціальний ключ шифрування, щоб навіть Meta не могла отримати доступ до вмісту всередині.

Цю версію реалізувати складніше, адже якщо Meta не може отримати доступ до внутрішньої частини віртуальної машини, налагодження та забезпечення належної роботи системи стає набагато складнішим. Тож ми витратили на це певний час, але вона незабаром буде запущена. Це фактично досягне стандарту безпеки, який люди вже знають у WhatsApp та наших інших найбільш захищених продуктах.

Ведучий: Чи перевага цього полягає лише в тому, щоб люди почувалися психологічно безпечніше, чи є реальні переваги?

Марк: Я вважаю, що безпека сама по собі важлива. Наша мета — наблизитися до того, щоб дати вам локальну машину під вашим столом. Що дає вам ця локальна машина? Це означає, що жодна компанія не може отримати до неї доступ.

Отже, припустімо, Meta хоче надати вам цю послугу, як ми можемо дати вам такий самий рівень гарантій конфіденційності та безпеки, щоб жодна компанія — чи то Meta, чи будь-хто, хто намагається зламати нас, чи в деяких країнах, де ви не довіряєте місцевому уряду — не могла отримати доступ? Тому що ми самі також не можемо потрапити всередину, бо в нас немає доступу.

Я вважаю, що це дуже важливо, і це також важлива причина, чому люди довіряють WhatsApp. Це справжня цінність для конфіденційності, безпеки та довіри.

Якщо у вас буде асистент, який знає про вас усе — гадаю, майже в усіх нас буде такий асистент — зазирнімо на 5 років уперед: у кожного буде асистент, який глибоко розуміє ваші цілі та все інше і може допомогти вам досягти результату. У такій ситуації бути лідером галузі за конфіденційністю та безпекою дуже важливо. Ми хотіли зробити це з самого початку.

Як формувати особистість ШІ?

Ведучий: Є ще одна дуже цікава річ — ви вивчали психологію в університеті.

Марк: Ну, я був там лише дуже короткий час, два роки, але відчуваю, що це вплинуло на багато речей, які я згодом створив.

Ведучий: Коли ми дивимося на моделі, ми часто говоримо, що певна модель «дуже розумна». Але так само, як ми обираємо друзів, це, звісно, тому що вони розумні, а також тому що нам подобається їхня енергія та те, як ми спілкуємося. Як ви думаєте про формування особистості моделі?

Марк: Я вважаю, що ідеальна модель має бути достатньо адаптивною, щоб відповідати стилям різних людей. Думаю, багато людей у галузі помиляються щодо цього — багато інших лабораторій зосереджені на «як правильно спроєктувати особистість», але я ніколи не вважав, що особистість — це щось фіксоване. Це одна з причин, чому я так сильно вірю у відкритий код, так сильно вірю, що люди можуть налаштовувати, і саме тому ми розробили Muse як високоперсоналізований продукт.

Ви можете налаштувати та персоналізувати Muse — не лише зовнішній вигляд і голос. Коли ви вперше реєструєтеся, перше, що він запитує: «якою ви хочете, щоб була моя базова особистість», і ви можете змінити це будь-коли.

Ми прагнемо зробити модель надзвичайно керованою, щоб ви могли визначити бажаний тип взаємодії. Це важлива частина того, щоб зробити її чудовим персональним асистентом — ця адаптивність щодо особистості є критично важливою.

Ведучий: Який стиль у вашого власного Muse?

Марк: Я зробив його прямим і орієнтованим на ефективність. Це досить цікаво. Ранні версії були дуже саркастичними та гумористичними, але поточна версія більш прямолінійна. Мій асистент використовує стандартний зовнішній вигляд Muse, але я одягнув його в тогу і дав йому глибокий, дещо комічний голос. Взаємодіяти з ним весело.

Ведучий: Я думаю, щоб мати почуття гумору, потрібно бути справді розумним. Багато людей не усвідомлюють, що коміки — одні з найрозумніших людей у суспільстві — швидка реакція, достатньо дотепності. У вас точно є ця риса. Дивлячись усі ваші інтерв'ю, ви завжди добре виступали.

Несподівані прогнози Марка щодо ШІ та метавсесвіту

Ведучий: В інтерв'ю з Тео ви багато говорили про наступний рубіж технологій і куди все це зрештою прямує. Галузь ШІ пережила кілька «зим», коли люди думали, що проривів не буде. Метавсесвіт також пережив кілька таких періодів, коли всі думали, що це ставка, яку неможливо реалізувати. Я спробував нову функцію голографічного аватара вчора, це дуже круто. В інтерв'ю з Лексом здавалося, що знадобиться 11 годин, щоб записати ваше обличчя, тепер це займає лише 3 хвилини. Як це просунулося до того, що ми маємо сьогодні?

Марк: У загальному розвитку метавсесвіту, коли ми заснували Reality Labs, ми завжди вірили, що зрештою з'являться звичайні окуляри з нормальним виглядом, і з часом вони зможуть як забезпечувати занурювальну присутність, так і стати чудовими пристроями ШІ — тому що окуляри — це єдина форма, яка дозволяє пристрою бачити те, що бачите ви, чути те, що чуєте ви, спілкуватися з вами біля вашого вуха цілий день і зрештою відображати зображення.

Але 10–15 років тому я припускав, що ми спочатку досягнемо голографічної технології, а потім високорозвиненого ШІ. Однак шлях технологічної еволюції цікавий — насправді ми отримали ШІ та персональний надінтелект спочатку, а вже потім технологію, щоб зробити голографічну технологію поширеною та достатньо доступною. Це те, чого я не передбачав, але я радий, що ми працюємо в обох напрямках.

Наші значні інвестиції в окуляри поставили нас у дуже вигідне становище, коли ШІ-асистенти будуть готові. Багато з анонсів на Connect були саме про впровадження Muse та багатьох функцій ШІ в окуляри, і я думаю, що користувачам це дуже сподобається. Це велика справа.

Щодо присутності, ми все ще просуваємося, але прогрес відносно повільніший, оскільки більшість нашої енергії перемістилася на створення Muse та функцій ШІ для окулярів. Однак у нас є давній проєкт щодо аватарів у реальному часі з високою точністю.

Як ви сказали, три-чотири роки тому вам потрібна була ціла сканувальна кімната, щоб записати людину з усіх боків, а потім вам були потрібні графічні процесори корпоративного рівня для рендерингу, що було дуже громіздко. Демо, яке ми зробили для подкасту Lex, було саме таким налаштуванням. Тепер ми фактично змусили це працювати в парі VR-окулярів — це перший форм-фактор окулярів, який може забезпечити такий дивовижний VR-досвід, а не великий шолом. Лише кілька фотографій можуть створити ваш аватар, і прогрес вражає.

Ведучий: І це також може керувати виразами обличчя на основі голосу. У демо це змусило мене сміятися, взаємодіяти, а потім зрозуміло, як моє обличчя рухається разом з аудіодоріжкою. Ви згадували в тому подкасті, що деякі люди, які зазвичай стримані у своїх виразах, насправді хочуть багатших виразів у віртуальному світі. Як ви дивитеся на те, що люди розрізняють своє «віртуальне Я» та «реальне Я»?

Марк: Я думаю, ми все ще дуже рано розуміємо соціологію та психологію цього. Я думаю, що сприйняття людьми себе та образ, який вони хочуть проєктувати, часто дещо відрізняються від того, ким вони є насправді. Від появи соціальних мереж люди ретельно обирали аватари. З аватарами Muse ми побачили подібне явище. Це не стільки «курування» себе, скільки «курування» тієї «людини», з якою ви хочете спілкуватися.

Я думаю, коли ви надаєте людям здатність виражати себе, ви хочете, щоб це справді передавало їх, і водночас це саме по собі є формою вираження, а не просто чистим дзеркальним відображенням — це і спілкування, і вираження. Ми сподіваємося створити щось, що балансує обидва. Це завжди ітеративний цикл: подивіться, як люди це використовують, потім покращуйте. Після багатьох років роботи ми тепер справді на стартовій лінії — вперше ми можемо справді впровадити досить якісні реалістичні аватари в продукти, які можна використовувати на телефонах і у VR. Я дуже схвильований побачити результати.

Як виглядатиме 2030 рік?

Ведучий: Гаразд, візьміть мене у свої роздуми, перенесімося до 2030 року, якщо все піде добре, як виглядатиме голографічна технологія? Голограми плюс Muse, плюс окуляри, як вони всі об’єднуються?

Марк: Моє розуміння концепції метавсесвіту завжди полягало в ефективному злитті фізичного світу з цифровим. Основна ідея така: у нас є цей чудовий фізичний світ, і водночас у нас є й чудовий цифровий світ — величезна кількість контенту, накопиченого в інтернеті за 20–30 років, що захоплює подих. Але спосіб, у який ми отримуємо до нього доступ, — це або сидіти за столом, або через маленький екран у кишені, що принципово дуже обмежено.

Я вважаю, що найідеальніша версія цього — це безшовне злиття фізичного та цифрового світів. Подумайте про це так: зараз ми двоє тут. У якійсь майбутній версії один із нас міг би бути голографічною проєкцією, але ви все одно відчуваєте, що кожен із вас справді присутній, що абсолютно відрізняється від відеодзвінка.

І суть віртуальної реальності саме в тому, щоб передати це відчуття присутності — змусити вас справді відчути, що ви перебуваєте в одній кімнаті з іншими або в іншому місці. Ви можете досягти цього за допомогою голографічної технології та змішувати це різними способами. Наприклад, я можу зіграти партію в покер із друзями, деякі з яких присутні, а інші приєднуються через голографічні аватари, і вони також можуть грати в карти, а сам картковий стіл також може бути голографічним, щоб ті, хто не присутній, також могли бути інтегровані в це.

Водночас ШІ також можна надати фізичної форми, і він з’явиться в цій сцені. У робочих сценаріях це має великий сенс — я вже постійно використовую різних агентів для програмування, щоб щось створювати. Уявіть собі: у вас є канал групового чату з кількома людьми та кількома агентами, і ви розподіляєте завдання між агентами. Але іноді всі збираються на зустріч, і агенти, можливо, також мають бути присутніми. Як вони з’являються? Просто — додайте ще кілька місць на дивані, і вони з’являться як голографічні аватари. Або використайте того милого персонажа Muse, або дракона, або будь-який дивний і химерний образ, який ви створите.

Гадаю, у майбутньому це відчуватиметься цілком природно.

Ведучий: Цікаво. У ваших попередніх інтерв’ю ви казали, що технологічна індустрія часто забуває про «розвагу». Я думаю, що поява фізичного асистента там також зробила б це більш реальним — наче робота справді передається на аутсорсинг. Коли ви бачите, як Muse друкує, ви відчуваєте, що щось справді відбувається. Це зроблено дуже добре — можливість бачити, що відбувається в браузері. Тож чи вважаєте ви, що такий сценарій можливий: ви вдягаєте окуляри, а потім керуєте своїм комп’ютером, дозволяючи Muse робити щось для вас на комп’ютері?

Марк: О, безумовно. VR уже може це робити. Ви можете просто знайти місце, щоб сісти, кафе підійде, а потім відкрити свою робочу станцію з шістьма моніторами, писати на них код — усе там.

Щодо окулярів, найпопулярніша наразі модель не має дисплея, що, з одного боку, робить їх доступнішими та дозволяє більшій кількості людей користуватися ними, а з іншого боку, ми все ще працюємо над тим, щоб вмістити дисплей у найкомпактнішу форму. Але ми вже випустили версію Meta Ray-Ban із дисплеєм, яка дуже популярна, і це маленький дисплей. Ми також випустили прототипну версію голографічної AR із повним полем зору, яка, на мою думку, буде дуже захопливою.

Тож уся продуктова лінійка виглядає так: від суто аудіоокулярів — без камери, які виглядають як звичайні окуляри, але з Muse всередині, що дозволяє використовувати різні аудіоінструменти, слухати музику, здійснювати дзвінки — до більш преміальних версій, усі вони існують.

Ведучий: Мені цікаво, з тими аудіоокулярами, чи можете ви говорити з Muse, одночасно змушуючи ваш домашній комп’ютер щось робити?

Марк: Так, абсолютно. Ми щойно випустили цю функцію на конференції Connect.Тепер усі окуляри підключені до Meta AI, що є «одноразовим» досвідом — ви надсилаєте запит, вона відповідає, і на цьому все. Але з Muse ми фактично збираємося оновити всі окуляри до Muse. По-перше, вам більше не потрібно казати «Hey Meta», ви можете дати їй будь-яке ім'я, що саме по собі є частиною забави. Потім ви просто говорите з нею безпосередньо, і вона підключається до вашого Muse, а ваш Muse виконує завдання у вашій захищеній віртуальній машині, допомагаючи вам завершувати справи.

Ведучий: Це неймовірно!

Мислення засновника

Ведучий: Гаразд, ми зараз тут, Muse прогресує гладко, і окуляри також добре працюють, але близько року тому багато людей запитували «що ж насправді сталося з лабораторією надінтелекту». У той момент, як ви почувалися всередині? Коли справи йдуть не добре, але ви все ще бачите довгострокове бачення, який це досвід?

Марк: Що насправді пішло не так, то це проєкт Llama та Llama 4.

Llama 1 була досить цікавою моделлю, вона започаткувала весь рух відкритого штучного інтелекту, і ми дуже пишаємося цим. Llama 2 досягла масштабу, Llama 3 була хорошою моделлю, майже на передовій на той час. Потім з'явилася Llama 4, і ми фактично відхилилися від траєкторії, на якій мали бути.

Щоразу, коли справи йдуть не так, як я очікую, я витрачаю багато часу на роздуми: чому це сталося? Що нам потрібно змінити, щоб зробити краще? Цього разу моє осмислення було таким: я неправильно побудував всю структуру команди.

Я змоделював це так, як ми робимо роботу з машинного навчання, як-от стрічка Instagram або рекламні системи — із сотнями або навіть тисячами людей, які працюють паралельно над багатьма речами. Але для створення мовних моделей вам насправді потрібна надзвичайно згуртована маленька команда, яка ставиться до цього як до групового наукового проєкту. Вам не потрібно багато людей, але це означає, що кожне місце в команді є надзвичайно цінним.

Тож ми зібрали найкращих людей з усього Meta, і водночас залучили багатьох блискучих людей з усієї галузі, сформувавши абсолютно нову команду — Meta Superintelligence Labs.

З моєї точки зору, коли MSL запустилася, я знав, що знадобиться деякий час, щоб перезапуститися, відбудувати інфраструктуру та навчити моделі наступного покоління. Але я знав, що ми зібрали чудову команду, і якщо команда зможе згуртуватися та добре працювати, результати будуть хорошими.

Для мене найзахопливіший момент, насправді був після випуску Llama 4 — я думав, що ми на правильному шляху, але виявилося, що ні. Це був досить великий негативний сюрприз. Я думаю, як підприємець, ви завжди проходите випробування в такі моменти, тому що неминуче не все буде йти гладко. І те, що справді визначає траєкторію, це: коли справи йдуть не так, як ви сподіваєтеся, як ви знаходите шлях уперед.

Ведучий: Я припускаю, що зворотне також правда — коли щось набагато перевершує ваші очікування, як-от запуск Muse, як ви переконуєтеся, що можете скористатися цією можливістю?

Марк: Саме так. Тепер вся компанія залучена — спочатку це була лише невелика команда, яка створювала продукт, але тепер усі усвідомлюють, що це справді готове для великої сцени. Уся компанія думає про те, як зробити цю річ масштабною, як дати сотням мільйонів людей відчути її.

Від оптимізації всієї інфраструктури, щоб усе працювало безперебійно, і вичавлювання кожного біта обчислювальної потужності з наявних GPU, до різних продуктових команд, які впроваджують Muse різними способами — наприклад, в окулярах. Бачити, як усі працюють разом, щоб забезпечити плавне масштабування Muse, — це чудове відчуття.

Як Марк пише та доносить бачення

Ведучий: Як засновник, я відчуваю, що це той момент, якого ти прагнеш найбільше — коли все складається докупи. Як ти доносиш бачення до компанії? Оскільки стільки всього просувається одночасно, я відчуваю, що ти багато пишеш. Який твій процес?

Марк: Письмо дуже допомагає мені, як у вдосконаленні власних думок, так і в зовнішній комунікації. Цього літа я написав дуже довгий твір під назвою «Майбутнє належить усім», близько 15 сторінок, який допоміг мені системно