Yapay zekâ ile video üretimiyle tanınan Pika Labs, ses alanına adım atıyor. Şirket 14 Ağustos'ta, üretken ses yelpazesinin tamamını kapsayan dört "sınır ölçeğinde temel ses modelinden" oluşan Pika Audio Models ailesini tanıttı: Soundtrack, Music, SFX ve Speech.

Pika Soundtrack, bir videoyu senkronize doğal film müziğine dönüştürüyor — ekranda olup biteni izleyen harekete duyarlı ses efektleri, müzik, ortam sesi ve seslendirme. Pika Music; metin istemlerini, şarkı sözlerini, ses referanslarını ve referans parçaları altı dakikaya kadar eksiksiz şarkılara dönüştürüyor. Pika SFX, doğal dildeki yönlendirmelerden net ve isteme sadık ses efektleri üretiyor; Pika Speech ise hazır sesler veya birkaç saniyelik referans sesten eğitilen ses klonuyla çalışan, ifade gücü yüksek bir metin-konuşma modeli.

Başlıca iddia fiyat. Pika, modellerin "piyasadaki en düşük fiyatlı ses modelleri — diğer ses modellerinden 20 kata kadar daha ucuz" olduğunu; bunun yüksek verimli eğitim ve çıkarım teknikleri, az adımlı üretim ve hızlı bir çıkarım altyapısı sayesinde mümkün olduğunu söylüyor. Somut olarak: Soundtrack, Hunyuan Foley'den 2 kat daha verimli; Speech, ElevenLabs v3'ten 9 kat (Cartesia ve ElevenLabs Turbo'dan 4,5 kat) daha verimli; Music ise benzer müzik modellerinden 10 kata kadar daha verimli.

Şirket ayrıca hız ve kalite rakamları da paylaştı: Soundtrack, üretilen saniye başına 0,617 saniye duvar süresiyle 529 saniyelik videoyu, kıyaslamalarındaki en güçlü anlamsal uyum ve en düşük görsel-işitsel senkron kaybıyla işledi; Music, 90 saniyelik bir şarkıyı ortalama 6,21 saniyede — oynatma hızından yaklaşık 14,5 kat hızlı — üretti; SFX, uçtan uca üretimi ortalama 0,847 saniyede tamamladı; Speech ise 0,02 gerçek zaman faktörüyle çalışıyor — bir dakikalık konuşma yaklaşık bir saniyede üretiliyor.

Modeller şu anda şirketin geliştirici platformu Pika API Club üzerinden kullanılabiliyor. Fiyat karşılaştırmaları 14 Ağustos 2026 itibarıyla sağlayıcıların resmi liste fiyatlarına dayanıyor.