HeadlinesBriefing HeadlinesBriefing 11 languages

I created an interactive digital avatar of myself — and you can talk to it

TechCrunch Venture ·

🇬🇧 English

After obtaining an interactive avatar and training it to discuss venture fraud, I have mixed feelings about making AI clones of ourselves.

When Alexandru Voica, head of corporate affairs at the video-generation startup Synthesia, sent me a link to their newest PR team member — an interactive virtual avatar of him — I was surprised. The day before, I was on a panel where PR people asked if I minded AI-generated text pitches. But Alexandru's avatar was beyond that — this seemed to me the final boss of using AI in PR.

In September, Synthesia invited me to its new office in New York. Originally based in the U.K., Synthesia is a hot digital avatar startup alongside others like D-ID, Hey Gen, and Colossyan. It hit a $4 billion valuation earlier this year and said last year it had crossed $100 million in ARR.

To make this, I entered a mini film studio at Synthesia's office where they took numerous photos of me and captured a two-minute recording of my voice. I had to consent to these avatars being made, and well, digital me was born. The voice-to-text model turns what people say into text, the agentic language model makes sense of text and can take actions based on it, the text-to-voice model turns a response into audio, and finally a video model animates the avatar as it talks.

View original article →


🇸🇦 العربية

أنا أنشأت نفسي الافتراضي التفاعلية

بعد حصولي على افتراضي تفاعلية وtrainingها على مناقشة الاحتيال على الاستثمارات، أشعر بمشاعر مختلطة حول إنشاء نسخ AI من أنفسنا.

عندما أرسل ألكساندرو فوycا، رئيس الشؤونporate في ناشئات إنتاج الفيديو Synthesia، رابطًا إلى عضو فريق relations العامة الجديد له - افتراضي تفاعلية له - تفاجأت. في اليوم الذي يليه، كنت في لجنة حيث سألت أناس relations العامة عما إذا ي botherهم نصوص AI-generated pitches. لكن افتراضي ألكساندرو كانت أبعد من ذلك - ب Seems لي أن هذا هو الـ final boss لاستخدام AI في relations العامة.

في سبتمبر، دعت Synthesia إلى مكتبه الجديد في New York. يقع Synthesia في الأصل في UK، وهو افتراضي تفاعلية ساخن إلى جانب آخرين مثل D-ID، Hey Gen، و Colossyan. بلغت قيمته 4 billion dollars في هذا العام، وقال في العام الماضي أنه تجاوز 100 million dollars in ARR.

لفعل هذا، دخلت إلى استوديو فيلم صغير في مكتب Synthesia حيث أخذوا numerous صور لي و captured recording من دقيقتين من صوتي. اضطررت إلى consent إلى أن هذه الافتراضيات تُصنع، و well، وُلد الافتراضي Digital. يحول نموذج voice-to-text ماsays إلى text، و نموذج language model يفهم text و يمكنه اتخاذ actions بناءً عليه، و يحول نموذج text-to-voice استجابة إلى audio، و أخيرًا نموذل video يُ animate الavatar بينما يتحدث.

كيف تعمل الافتراضيات التفاعلية AI مثل Synthesia's؟

الافتراضيات التفاعلية تجمع بين نماذج voice-to-text، language، text-to-voice، و video. يحول voice-to-text speech إلى text، و نموذج language ي Processes responses، و text-to-voice ي generate audio، و نموذل video ي animate الavatar بينما يتحدث.

العربية version →


🇧🇩 বাংলা

আমি আমার নিজের ইনটার্যাক্টিভ ডিজিটাল অ্যাভাটার তৈরি করেছি

একটি ইনটার্যাক্টিভ অ্যাভাটার গ্রহণ করে এবং একে ভেঞ্চার প্রতারণা সম্পর্কে আলাপ করার জন্য প্রশিক্ষিত করে, আমার মধ্যে মিশ্রিত অনুভূতি রয়েছে যে আমাদের নিজের AI ক্লোন তৈরি করা নিয়ে।

যখন সিন্থেসিয়ার কর্পোরেট বিষয়ের প্রধান আলেকজান্দ্রু ভোয়িকা আমাকে তার সরকারি প্রচার দলের নতুন সদস্যের দিকে নির্দেশিত লিংক পাঠিয়েছিলেন — তার একটি ইনটার্যাক্টিভ ভার্চুয়াল অ্যাভাটার — আমি অবাক হয়ে গেলাম। গত দিনে, আমি একটি প্যানেলে ছিলাম যেখানে প্রচারকরা জিজ্ঞাসা করেছিল যে আমি কি আইএ-জেনারেটেড টেক্সট পিচেস নিয়ে উদ্বিগ্ন। কিন্তু আলেকজান্দ্রুর অ্যাভাটার তার চেয়ে অনেক বেশি ছিল — আমার মনে হয়েছিল যে এটি প্রচারে আইএর ব্যবহারের শেষ বস ছিল।

সেপ্টেম্বরে, সিন্থেসিয়া আমাকে তার নতুন অফিসে নিউইর্কে আমন্ত্রিত করেছিল। প্রাথমিকভাবে ইউকে-এ ভিত্তিক, সিন্থেসিয়া হলো একটি গরম ডিজিটাল অ্যাভাটার স্টার্টআপ, অন্যান্যগুলির মতো ডি-আইডি, হে জেন, এবং কলোসিয়নের সাথে। এটি এই বছরের প্রাথমিকে 4 বিলিয়ন ডলারের মূল্যাঙ্কন করেছিল এবং গত বছর বলেছিল যে এটি 100 মিলিয়ন ডলারের এআরআর অতিক্রম করেছে।

এটি তৈরি করার জন্য, আমি সিন্থেসিয়ার অফিসে একটি মিনি ফিল্ম স্টুডিওতে গিয়েছিলাম যেখানে তারা আমার অনেক ছবি তুলে ধরেছিল এবং আমার কণ্ঠের দুই মিনিটের একটি রেকর্ডিং করেছিল। আমাকে এই অ্যাভাটারগুলো তৈরি করার অনুমতি দিতে হয়েছিল, এবং ভালো, ডিজিটাল আমি জন্ম নিয়েছে। ভয়-টু-টেক্সট মডেল লোকদের কথা টেক্সটে রূপান্তর করে, এজেন্ট ল্যাঙ্গুয়েজ মডেল টেক্সট বোঝে এবং তার ভিত্তিতে কর্মকাণ্ড গ্রহণ করতে পারে, টেক্সট-টু-ভয় মডেল একটি প্রতিক্রিয়াকে অডিওতে রূপান্তর করে, এবং শেষ পর্যন্ত একটি ভিডিও মডেল অ্যাভাটারকে কথা বলার সময় অ্যানিমেট করে।

সিন্থেসিয়ার মতো ইনটার্যাক্টিভ আইএ অ্যাভাটারগুলো কিভাবে কাজ করে?

ইনটার্যাক্টিভ অ্যাভাটারগুলো ভয়-টু-টেক্সট, ল্যাঙ্গুয়েজ, টেক্সট-টু-ভয়, এবং ভিডিও মডেলগুলো মিশ্রিত করে। ভয়-টু-টেক্সট কথাকে টেক্সটে রূপান্তর করে, একটি ল্যাঙ্গুয়েজ মডেল প্রতিক্রিয়াগুলো প্রক্রিয়া করে, টেক্সট-টু-ভয় অডিও তৈরি করে, এবং একটি ভিডিও মডেল অ্যাভাটারকে কথা বলার সময় অ্যানিমেট করে।

বাংলা version →


🇪🇸 Español

Creé un avatar digital interactivo de mí mismo

Después de obtener un avatar interactivo y entrenarlo para discutir fraude de riesgo capital, tengo sentimientos mixtos sobre hacer clones IA de nosotros mismos.

Cuando Alexandru Voica, jefe de asuntos corporativos de la startups de generación de video Synthesia, me envió un enlace a su nuevo miembro del equipo de relaciones públicas — un avatar virtual interactivo de él — me sorprendió. El día anterior, estaba en un panel donde las personas de relaciones públicas preguntaban si me importaban los textos generados por IA. Pero el avatar de Alexandru iba más allá de eso — me pareció que era el jefe final de usar IA en relaciones públicas.

En septiembre, Synthesia me invitó a su nueva oficina en Nueva York. Originalmente basada en el Reino Unido, Synthesia es una startups de avatares digitales de moda junto con otras como D-ID, Hey Gen y Colossyan. Alcanzó una valoración de 4 mil millones de dólares earlier este año y el año pasado dijo que había cruzado 100 millones de dólares en ARR.

Para hacer esto, entré en un mini estudio de cine en la oficina de Synthesia donde tomaron numerosas fotos de mí y capturaron una grabación de dos minutos de mi voz. Tuve que consentir que se hicieran estos avatares, y bien, nació el digital yo. El modelo de voz a texto convierte lo que dicen las personas en texto, el modelo de lenguaje agente entiende el texto y puede tomar acciones basadas en él, el modelo de texto a voz convierte una respuesta en audio, y finalmente un modelo de video anima el avatar mientras habla.

¿Cómo funcionan los avatares IA interactivos como el de Synthesia?

Los avatares interactivos combinan modelos de voz a texto, lenguaje, texto a voz y video. El voz a texto convierte el habla en texto, un modelo de lenguaje procesa las respuestas, el texto a voz genera audio, y un modelo de video anima el avatar mientras habla.

Español version →


🇫🇷 Français

J'ai créé un avatar numérique interactif de moi-même

Après avoir obtenu un avatar interactif et l'avoir formé pour discuter de la fraude en capital-investissement, j'ai des sentiments mitigés sur la création de clones IA de nous-mêmes.

Lorsque Alexandru Voica, chef des affaires corporatives chez la start-up de génération de vidéo Synthesia, m'a envoyé un lien vers le nouveau membre de son équipe relations publiques — un avatar virtuel interactif de lui — j'ai été étonné. La veille, j'étais sur un panel où les gens des relations publiques demandaient si je m'importais des pitches texte générés par IA. Mais l'avatar d'Alexandru allait au-delà de cela — cela me semblait le final boss de l'utilisation de l'IA en relations publiques.

En septembre, Synthesia m'a invité à son nouveau bureau à New York. Initialement basé au Royaume-Uni, Synthesia est une start-up d'avatars numériques chaude avec d'autres comme D-ID, Hey Gen, et Colossyan. Elle a atteint une évaluation de 4 milliards de dollars plus tôt cette année et a dit l'année dernière avoir dépassé 100 millions de dollars en ARR.

Pour faire cela, je suis entré dans un mini studio de film au bureau de Synthesia où ils ont pris de nombreuses photos de moi et capturé une enregistrement de deux minutes de ma voix. J'ai dû consentir à la création de ces avatars, et bien, le digital moi est né. Le modèle voice-to-text convertit ce que les gens disent en texte, le modèle language model comprend le texte et peut prendre des actions basées dessus, le modèle text-to-voice convertit une réponse en audio, et enfin un modèle video anime l'avatar alors qu'il parle.

Comment fonctionnent les avatars IA interactifs comme celui de Synthesia ?

Les avatars interactifs combinent les modèles voice-to-text, language, text-to-voice, et video. Le voice-to-text convertit la parole en texte, un modèle language traite les réponses, le text-to-voice génère de l'audio, et un modèle video anime l'avatar alors qu'il parle.

Français version →


🇮🇳 हिन्दी

मैंने अपना खुद का इंटरैक्टिव डिजिटल एवतार बनाया

एक इंटरैक्टिव एवतार प्राप्त करके और इसे वेंचर धोखे के बारे में बात करने के लिए प्रशिक्षित करके, मुझे अपने आप के AI क्लोन बनाने के बारे में मिश्रित भावनाएं हैं।

जब सिंथेसिया के कॉरपोरेट मामलों के प्रमुख एलेक्ज़ांड्रु वोइका ने मुझे उनके नए पीआर टीम के सदस्य — उनका एक इंटरैक्टिव वर्चुअल एवतार — का लिंक भेजा, तो मैं हैरान हो गया। पिछले दिन, मैं एक पैनल में था जहाँ पीआर लोगों ने पूछा कि क्या मैं आईए जनरेटेड टेक्स्ट पिचेस के बारे में चिंतित हूँ। लेकिन एलेक्ज़ांड्रु का एवतार उससे आगे था — मुझे लगा कि यह पीआर में आईए का उपयोग करने का अंतिम बॉस था。

सितंबर में, सिंथेसिया ने मुझे न्यूयॉर्क में उनके नए कार्यालय में आमंत्रित किया। मूल रूप से यूके में स्थित, सिंथेसिया एक गर्म डिजिटल एवतार स्टार्टअप है जैसे कि डी-आईडी, हे जेन और कॉलॉसियन के साथ-साथ। इसने इस साल पहले 4 बिलियन डॉलर का मूल्यांकन किया और पिछले साल कहा कि उसने 100 मिलियन डॉलर का एआरआर पार किया।

यह बनाने के लिए, मैं सिंथेसिया के कार्यालय में एक मिनी फिल्म स्टूडियो में गा जहाँ उन्होंने मेरी कई तस्वीरें ली और मेरी आवाज का एक दो मिनट की रिकॉर्डिंग की। मुझे इन एवतारों को बनाने की अनुमति देनी थी, और अब, डिजिटल मैं जन्म लिया। आवाज से टेक्स्ट मॉडल लोगों की बात को टेक्स्ट में बदलता है, एजेंट लैंग्वेज मॉडल टेक्स्ट को समझता है और इसके आधार पर कार्रवाई ले सकता है, टेक्स्ट से आवाज मॉडल एक प्रतिक्रिया को ऑडियो में बदलता है, और अंत में एक वीडियो मॉडल एवतार को बोलते समय एनीमेट करता है।

सिंथेसिया जैसे इंटरैक्टिव आईए एवतार कैसे काम करते हैं?

इंटरैक्टिव एवतार आवाज से टेक्स्ट, लैंग्वेज, टेक्स्ट से आवाज और वीडियो मॉडल्स को जोड़ते हैं। आवाज से टेक्स्ट बोली को टेक्स्ट में बदलता है, एक लैंग्वेज मॉडल प्रतिक्रियाओं को प्रोसेस करता है, टेक्स्ट से आवाज ऑडियो जनरेट करता है, और एक वीडियो मॉडल एवतार को बोलते समय एनीमेट करता है।

हिन्दी version →


🇮🇩 Bahasa Indonesia

Saya membuat avatar digital interaktif dari diri saya sendiri

Setelah mendapatkan avatar interaktif dan melatihnya untuk membicarakan penipuan ventura, saya merasa campuran tentang membuat klon AI dari diri kita sendiri.

Ketika Alexandru Voica, kepala urusan korporat di startup produksi video Synthesia, mengirimkan saya link ke anggota tim PR terbaru mereka — avatar virtual interaktif dari dirinya — saya terkejut. Sebelumnya, saya berada di panel di mana orang-orang PR menanyakan apakah saya keberatan dengan pitch teks yang dihasilkan AI. Tapi avatar Alexandru melampaui itu — ini terasa seperti bos akhir dari penggunaan AI dalam PR.

Di September, Synthesia mengundang saya ke kantor baru mereka di New York. Awalnya berbasis di Inggris, Synthesia adalah startup avatar digital yang panas bersama dengan yang lain seperti D-ID, Hey Gen, dan Colossyan. Mereka mencapai valuasi 4 miliar dolar lebih awal tahun ini dan tahun lalu mengatakan bahwa mereka telah melewati 100 juta dolar ARR.

Untuk membuat ini, saya masuk ke mini studio film di kantor Synthesia di mana mereka mengambil banyak foto saya dan merekam dua menit suara saya. Saya harus setuju untuk membuat avatar-avatar ini, dan well, digital saya lahir. Model voice-to-text mengubah apa yang orang katakan menjadi teks, model bahasa agen memahami teks dan dapat mengambil tindakan berdasarkan itu, model text-to-voice mengubah respons menjadi audio, dan terakhir model video menganimasikan avatar sementara berbicara.

Bagaimana avatar AI interaktif seperti Synthesia bekerja?

Avatar interaktif menggabungkan model voice-to-text, bahasa, text-to-voice, dan video. Voice-to-text mengubah bicara menjadi teks, model bahasa memproses respons, text-to-voice menghasilkan audio, dan model video menganimasikan avatar sementara berbicara.

Bahasa Indonesia version →


🇯🇵 日本語

自分自身の対話型デジタルアバターを作成しました

対話型アバターを取得し、ベンチャー詐欺について議論するように训练した後、私たち自身のAIクローンを作成することについて複雑な感情を持っています。

ビデオ生成スタートアップSynthesiaの企業事务責任者アレクサンドル・ボイカが、彼のPRチームの新しいメンバー——彼自身の対話型仮想アバター——への links を送ったとき、私は驚きました。前日、私はパネルに参加し、PRの人々がAI生成のテキストピッチについて迷惑しているかどうかを尋ねでした。しかし、アレクサンドルのアバターはそれ以上でした——これはPRにおけるAIの使用の最終ボスだと私には思えました。

9月、Synthesiaはニューヨークの新しいオフィスに招待しました。イギリスを拠点とするSynthesiaは、D-ID、Hey Gen、Colossyanなどの他の会社とともに、ホットなデジタルアバタースタートアップです。今年初頭に40億ドルの評価に達し、昨年は1億ドルのARRを突破したと発表しました。

これを作成するために、私はSynthesiaのオフィスにあるミニ映画スタジオに入り、多くの写真を撮られ、2分間の音声録音を行いました。私はこれらのアバターが作成することに同意する必要があり、そして、デジタルの私が生まれました。音声からテキストへのモデルが人々が说的话をテキストに変換し、エージェント言語モデルがテキストを理解し、据此てアクションを実行し、テキストから音声へのモデルが応答を音声に変換し、最後にビデオモデルがアバターが話す間にアニメーション付けます。

Synthesiaのような対話型AIアバターはどのように機能しますか?

対話型アバターは、音声からテキスト、言語、テキストから音声、ビデオモデルを組み合わせます。音声からテキストモデルが音声をテキストに変換し、言語モデルが応答を処理し、テキストから音声モデルが音声を生成し、ビデオモデルがアバターが話す間にアニメーション付けます。

日本語 version →


🇧🇷 Português

Criei um avatar digital interativo de mim mesmo

Após obter um avatar interativo e treiná-lo para discutir fraude de venture capital, tenho sentimentos mistos sobre fazer clones IA de nós mesmos.

Quando Alexandru Voica, chefe de assuntos corporativos da startup de geração de vídeo Synthesia, me enviou um link para o novo membro da equipe de PR dele — um avatar virtual interativo dele — fiquei surpreso. No dia anterior, eu estava em um painel onde as pessoas de perguntaram se me incomodava pitches de texto gerados por IA. Mas o avatar de Alexandru ia além disso — parecia-me o chefe final do uso de IA em PR.

Em setembro, a Synthesia me convidou para seu novo escritório em Nova York. Originalmente baseado no Reino Unido, a Synthesia é uma startup de avatar digital quente junto com outras como D-ID, Hey Gen, e Colossyan. Ela atingiu uma valuation de 4 bilhões de dólares mais cedo este ano e disse no ano passado que tinha ultrapassado 100 milhões de dólares em ARR.

Para fazer isso, entrei em um mini estúdio de cinema no escritório da Synthesia onde eles tiraram várias fotos de mim e capturaram uma gravação de dois minutos da minha voz. Eu precisei consentir que esses avatares fossem feitos, e bem, o digital eu nasceu. O modelo voice-to-text converte o que as pessoas dizem em texto, o modelo de linguagem agente entende o texto e pode tomar ações com base nele, o modelo text-to-voice converte uma resposta em áudio, e finalmente um modelo de video anima o avatar enquanto fala.

Como os avatares IA interativos como o da Synthesia funcionam?

Os avatares interativos combinam modelos de voice-to-text, linguagem, text-to-voice e video. O voice-to-text converte a fala em texto, um modelo de linguagem processa respostas, o text-to-voice gera áudio, e um modelo de video anima o avatar enquanto fala.

Português version →


🇷🇺 Русский

Я создал интерактивный цифровой аватар себя самого

Получив интерактивный аватар и обучив его обсуждать венчурное мошенничество, я испытываю смешанные чувства по поводу создания AI-клонов ourselves.

Когда Александру Войка, руководитель корпоративных дел стартапа по генерации видео Synthesia, отправил мне ссылку на нового члена его PR-команды — интерактивного виртуального аватара себя — я был удивлен. Накануне я участвовал в панели, где PR-спрашивали, если ли я против текстовых питчей, сгенерированных ИИ. Но аватар Александру был за гранью этого — мне показалось, что это финальный босс использования ИИ в PR.

В сентябре Synthesia пригласила меня в свой новый офис в Нью-Йорке. Изначально базировавшаяся в Великобритании, Synthesia — горячий стартап цифровых аватаров наряду с такими, как D-ID, Hey Gen и Colossyan. Она оценивалась в 4 миллиарда долларов в этом году и в прошлом году сообщила, что перешагнула порог в 100 миллионов долларов ARR.

Для этого я зашел в мини-киностудию в офисе Synthesia, где мне сделали множество фотографий и записали двухминутную запись моего голоса. Мне пришлось дать согласие на создание этих аватаров, и, well, цифровое меня родилось. Модель voice-to-text превращает то, что люди говорят, в текст, агентивная языковая модель понимает текст и может предпринимать действия на его основе, модель text-to-voice превращает ответ в аудио, и, наконец, видео-модель анимирует аватар во время разговора.

Как работают интерактивные AI-аватары, подобные Synthesia's?

Интерактивные аватары объединяют voice-to-text, language, text-to-voice и video модели. Voice-to-text преобразует речь в текст, языковая модель обрабатывает ответы, text-to-voice генерирует аудио, а видео-модель анимирует аватар во время разговора.

Русский version →


🇨🇳 简体中文

我创建了自己的交互式数字头像

在获得一个交互式头像并训练其讨论风险投资欺诈后,我对制作我们自己的AI克隆体有了复杂感受。

当视频生成初创公司Synthesia的企业事务负责人Alexandru Voica发给我一个链接,指向他们最新公关团队成员——一个交互式虚拟头像时,我感到惊讶。前一天,我刚参加了一个小组讨论,公关人员问我是否介意AI生成的文本提案。但Alexandru的头像远不止于此——在我看来,这是在公关中使用AI的最终 bosses。

九月,Synthesia邀请我前往其位于纽约的新办公室。Synthesia最初总部位于英国,是一家热门的数字头像初创公司,与D-ID、Hey Gen和Colossyan等公司齐名。今年早些时候,该公司估值达到40亿美元,并在去年表示其年经常性收入已突破1亿美元。

为了制作这个头像,我进入了Synthesia办公室的一个迷你电影工作室,他们为我拍摄了多张照片,并录制了一段两分钟的语音。我必须同意制作这些头像,于是,数字版的我诞生了。语音转文本模型将人们所说的内容转化为文本,智能语言模型理解文本并可据此采取行动,文本转语音模型将响应转化为音频,最后,视频模型在头像说话时为其制作动画。

像Synthesia这样的交互式AI头像是如何工作的?

交互式头像结合了语音转文本、语言、文本转语音和视频模型。语音转文本将语音转换为文本,语言模型处理响应,文本转语音生成音频,视频模型使头像在说话时产生动画。

简体中文 version →