Google'dan Konuşan Avatar ve 100+ Dilde Yapay Zekâ Seslendirme

Bir tanıtım filmini bugün beş dilde yayınlamak istiyorsanız, önünüzde hâlâ uzun bir liste var: seslendirme sanatçıları, stüdyo saatleri, her dil için ayrı kurgu ve onay turu. Bu hafta açıklanan üç gelişme, bu listenin önemli bir kısmını yazılıma devrediyor. Ses artık yönetilebilir, yüz artık canlı konuşabiliyor, yayın artık anlık dublajlanabiliyor.
Ama her kolaylığın bir faturası var. O fatura bu kez izin, filigran, benzerlik hakları ve telif başlıklarında kesiliyor. Bu yazıda ne değiştiğini, ihracat yapan markalar için nerede gerçek bir fırsat olduğunu ve nerede dikkatli olmanız gerektiğini anlatıyoruz.
Ne değişti?
Ses, yönetmen koltuğuna geçti. Google, 23 Eylül’de Gemini 3.8 Flash TTS ve Flash-Lite TTS modellerini duyurdu. TTS (text-to-speech), yazılı metni sese çeviren teknoloji demek. Duyuruya göre modeller 100’ü aşkın dilde, 2.000’den fazla hazır sesle çalışıyor; doğal dille tarif ederek yeni bir ses tasarlanabiliyor, performans satır satır yönetilebiliyor ve iki konuşmacılı sahneler kurulabiliyor. En çok konuşulacak özellik ise ses kopyalama: 30 saniyelik bir örnekle bir sesin kopyası oluşturulabiliyor, ancak bunun için ses sahibinin sözlü onay kaydı gerekiyor. Ses kopyalama Illinois, Teksas, Avrupa Ekonomik Alanı, Birleşik Krallık, İsviçre ve Hindistan’da kullanılamıyor. Üretilen her ses SynthID filigranı taşıyor.
Yüz, gerçek zamanlı konuşmaya başladı. Bir gün sonra gelen Gemini 3.8 Live with Live Avatar, yapay zekâ asistanlarına dudak senkronlu, neredeyse gerçek zamanlı konuşan bir avatar ekliyor. Google 97 dil desteğinden söz ediyor. Yüksek kaliteli bir referans görselden markaya özel avatar üretmek mümkün, ama şimdilik yalnızca kurumsal izin listesindeki şirketlere açık. Özellik Gemini Enterprise’da; fiyat açıklanmadı. Çıktılar yine SynthID ile işaretleniyor.
Yayın, kendi kendini dublajlıyor. Made on YouTube 2026 etkinliğinde YouTube, canlı yayınlar için gerçek zamanlı otomatik dublajı ve benzerlik (likeness) tespitinin mobile geleceğini açıkladı. Likeness tespiti; yüzünüzün izinsiz kullanıldığı videolar için eşleşme uyarısı alıp işlem başlatmanızı sağlıyor ve YouTube konuşma sesini de bu tespite eklemeyi planlıyor. Aynı etkinlikte üç farklı kurguya kadar video A/B testi de duyuruldu.
Markanız için ne anlama geliyor?
Tek cümleyle: ses ve yüz artık bir kez üretilen değil, yönetilen marka varlıkları. Logonuz ve renk paletiniz gibi, markanızın sesi ve dijital sözcüsü de bir sistemin parçası hâline geliyor.
İhracat yapan markalar için bu somut bir fırsat. Fuar filmi, ürün tanıtımı ya da yatırımcı sunumu artık tek dilde kalmak zorunda değil. Aynı kurgunun Almanca, İspanyolca ve Arapça versiyonları, aynı ton ve aynı karakterle, çok daha kısa sürede hazırlanabiliyor. Canlı avatar ise web sitesinde müşteriyi karşılayan, fuar standında soruları yanıtlayan ya da ürün eğitimini farklı dillerde anlatan bir “marka yüzü” senaryosunu masaya getiriyor.
Ama fırsatın hemen yanında dört ciddi risk duruyor:
- İzin. Bir sesi kopyalamak teknik olarak 30 saniye; hukuken ise açık, yazılı ve kapsamı belli bir izin gerektiriyor. Google’ın sözlü onay kaydı şartı bir alt sınır, sözleşmenin yerini tutmaz. Kimin sesi, hangi dillerde, hangi mecralarda, ne kadar süreyle? Bunlar önceden yazılmalı.
- Filigran ve şeffaflık. SynthID, içeriğin yapay zekâyla üretildiğinin tespit edilebilmesini sağlıyor. Bu iyi bir şey; ama “kimse fark etmez” varsayımıyla iş kurmayın. İzleyiciye yapay zekâ kullandığınızı açıkça söylemek, sonradan ortaya çıkmasından her zaman daha ucuzdur.
- Benzerlik hakları. Bir çalışanınızın, kurucunuzun ya da bir oyuncunun yüzünden avatar üretmek, o kişinin yüzünü markanıza kiralamak demek. Kişi şirketten ayrılırsa ne olacak? YouTube’un likeness tespitini yaygınlaştırması, bu alanın platformlar tarafından da izlenmeye başladığını gösteriyor.
- Müzik lisansı. Sesi ve yüzü çözdünüz, müziği unutmayın. Universal ve Sony, Engadget’ın aktardığına göre Suno’nun Warner, BMG ve Believe lisanslarıyla çıkardığı v6 modeline karşı da dava açtı. İddia, v6’nın, izinsiz eğitildiği öne sürülen önceki modellerin çıktıları ve bu modellerden türetilen tercih sinyalleriyle eğitildiği yönünde; dava en az 60.202 kaydı kapsıyor, Suno ise iddiaları reddediyor. Ders açık: “lisanslı model” etiketi bile reklam filmindeki müziğiniz için tek başına yeterli bir güvence değil.
Bir de coğrafya meselesi var. Ses kopyalamanın AEA ve Birleşik Krallık’ta kapalı olması, Avrupa’yı hedefleyen bir marka için bu özelliğin tam da en çok ihtiyaç duyulan yerde sınırlı kalabileceği anlamına geliyor. Planınızı bir aracın tek bir özelliğine bağlamayın.
Uygulanabilir adımlar
- Önce ses kimliğinizi tanımlayın. Markanızın sesi sıcak mı, otoriter mi, genç mi? Bunu marka kılavuzuna tipografi kadar net yazın. Doğal dille ses tasarlanabilen bir dönemde, iyi bir tarif en değerli girdi.
- İzin sözleşmesini üretimden önce hazırlayın. Ses ya da yüz kullanılacak her kişi için dil, mecra, süre ve ayrılık durumunu kapsayan yazılı bir izin alın.
- Hazır ses ile kopya sesi ayırın. Çoğu iş için 2.000’i aşkın hazır ses arasından seçim yapmak, gerçek bir kişinin sesini kopyalamaktan hem daha hızlı hem daha az riskli.
- Her dili ana dili konuşan birine dinletin. Yapay zekâ telaffuzu doğru yapabilir; ama bir sloganın o pazarda nasıl algılandığını ancak o dili yaşayan biri söyleyebilir.
- Müziği ayrı bir kalem olarak lisanslayın. Lisans kaynağı belgelenmiş kütüphaneler ya da özgün beste; kaynağı belirsiz üretken müzik değil.
- Yapay zekâ kullanımını açıkça belirtin. Açıklama metninde ya da künyede tek bir satır, güven kaybını önler.
- Canlı avatarı küçük başlatın. Önce tek bir senaryo (örneğin ürün SSS’i), tek bir dil ve ölçülebilir bir hedefle deneyin; sonra genişletin.
Klyne olarak önerimiz
Gala Fresh için (MBA Tarım) Madrid’deki Fruit Attraction ve Hong Kong’daki Fruit Logistica Asia fuarlarına özel yapay zekâ animasyon filmleri ürettik. Yurt dışındaki bir kitle için hazırlanan bu tür filmlerin doğal sonraki adımı, aynı karakterin ve aynı hikâyenin birden fazla dilde anlatılması. Bu haftaki gelişmeler, o adımı çok daha erişilebilir kılıyor.
Yaklaşımımız basit: araç değişir, sistem kalır. Bir yapay zekâ animasyon filmi planlarken karakteri, sesi, müziği ve dil versiyonlarını baştan birlikte düşünüyoruz. İzin ve lisans süreçlerini üretimin parçası olarak ele alıyor, her dil versiyonunu kurgu ve motion graphics tarafında o pazara göre uyarlıyoruz. Yüz yüze anlatım gereken yerde ise gerçek çekimi tercih ediyoruz; video prodüksiyon ile yapay zekâ üretimini aynı ekipte, tek çatı altında birleştiriyoruz.
Hangi işte yapay zekâ sesinin, hangisinde gerçek bir seslendirme sanatçısının doğru seçim olduğunu birlikte planlayalım. Çok dilli bir film ya da markanız için bir dijital sözcü düşünüyorsanız bize yazın.
Sıkça sorulan sorular
Yapay zekâ ile kendi sesimi ya da bir çalışanımın sesini kopyalayabilir miyim?
Google’ın duyurusuna göre Gemini 3.8 TTS, 30 saniyelik bir örnekten ses kopyalayabiliyor; ancak ses sahibinin sözlü onay kaydı gerekiyor ve özellik AEA, Birleşik Krallık, İsviçre, Hindistan, Illinois ve Teksas’ta kullanılamıyor. Teknik onayın ötesinde, kapsamı belli yazılı bir izin sözleşmesi yapmanızı öneriyoruz.
Yapay zekâ ile üretilen ses ve videolar anlaşılır mı?
Google, hem TTS hem Live Avatar çıktılarını SynthID filigranıyla işaretliyor; bu filigran içeriğin yapay zekâyla üretildiğinin tespit edilmesine yardımcı oluyor. Bu yüzden yapay zekâ kullanımını gizlemek yerine açıkça belirtmek daha sağlıklı.
Reklam filmimde yapay zekâ ile üretilmiş müzik kullanmak güvenli mi?
Şu an için temkinli olmak gerekiyor. Universal ve Sony’nin Suno’ya açtığı ikinci dava, lisans anlaşmaları olan bir modelin bile hukuki tartışmanın dışında kalmadığını gösteriyor. Ticari işlerde lisans kaynağı belgelenmiş müzik ya da özgün beste tercih etmenizi öneriyoruz.
Kaynaklar
- Gemini 3.8 text-to-speech says hello · Google Blog
- Introducing Gemini 3.8 Live with Live Avatar · Google Blog
- Made On YouTube 2026: All Announcements & New Features · YouTube Blog
- Sony Music and UMG say Suno's new models still violate their copyright · Engadget


