GPT‑Live‑1 API’de geliştiricilere açıldı
OpenAI, GPT‑Live‑1 modelini API üzerinden kullanıma sunduğunu açıkladı. Şirketin açıklamasına göre model, sesli uygulamalar ve iş akışları için tasarlandı; aynı anda dinleyip konuşabiliyor. OpenAI, bu yaklaşımın ChatGPT’de ilk kez kullanılan doğal ve tam çift yönlü konuşma deneyimini API’ye taşıdığını belirtiyor.
Duyurudaki en önemli değişiklik, sesli etkileşimin konuşmayı metne çevirme, bir dil modeliyle işleme ve yeniden sese dönüştürme aşamalarını ayrı ayrı birleştiren geleneksel zincir yerine tek bir ses modeli üzerinden yürütülmesi. OpenAI’ye göre bu yapı, gecikmeyi ve farklı aşamalar arasındaki kırılgan aktarım noktalarını azaltmayı hedefliyor.
Kesintiler ve eşzamanlı konuşma için tek model yaklaşımı
Geleneksel sesli ajan mimarilerinde konuşmadan metne, akıl yürütme ve metinden konuşmaya sistemleri arasındaki aktarımın zamanlama, bağlam ve konuşma ritmi sorunları yaratabildiği belirtiliyor. OpenAI, GPT‑Live‑1’in gelen ve giden sesi birlikte değerlendirdiğini; bu sayede kullanıcının araya girmesi, duraklaması veya konuyu değiştirmesi gibi durumlara yanıt verebildiğini söylüyor.
Modelin ses katmanını üstlendiği, daha derin akıl yürütme ve araç çağrısı gerektiren işleri ise arka uçtaki metin modeline devredebileceği ifade ediliyor. Bu kullanımda geliştiriciler, konuşmanın arkasında çalışacak modeli, araçları ve ajan altyapısını kendileri seçebiliyor. OpenAI, GPT‑6 Astra veya üçüncü taraf bir modelin bu amaçla eşleştirilebileceğini örnek gösteriyor.
GPT‑Live‑1 için kontrol ve konuşma ayarları
OpenAI’nin verdiği bilgilere göre geliştiriciler, sistem istemi aracılığıyla sesli ajanın tonunu, konuşma hızını ve sohbet tarzını yönlendirebiliyor. Modelin arka plan gürültüsü ve sessizlik anlarını konuşmayı kesmeden ele alma konusunda iyileştirildiği de duyuruda yer alıyor.
Şirket ayrıca uzun süreli oturumlarda bağlamı koruma ve konuşma kalitesini sürdürme tarafında geliştirmelerden söz ediyor. GPT‑Live‑1, otomatik konuşma tanıma dökümleri ile yanıt metnini yerel olarak sağlıyor. Alfasayısal ifadeleri anlama ve anahtar kelime yönlendirme desteği de modelin belirtilen özellikleri arasında bulunuyor.
Model, sıra tabanlı bir sistem olarak tanımlanmasa da açık konuşma sırası sınırlarıyla çalışmak isteyen geliştiriciler için yerel sıra algılama desteği sunuyor. Bu özellik, mevcut uygulama mantığının belirli kullanıcı ve ajan konuşma turlarına göre kurulabildiği senaryolarda kullanılabilecek.
Açıklanan değerlendirme sonuçları
OpenAI, kendi değerlendirmelerinde GPT‑Live‑1’in Full Duplex Bench skorunda GPT‑Realtime‑2.1’e göre 30 puanlık artış elde ettiğini açıkladı. Şirket, bu değerlendirmede konuşma sırası gecikmesi ve etkileşimli davranışlarda büyük kazanımlar görüldüğünü belirtiyor.
Duyuruya göre GPT‑Live‑1, orta düzey akıl yürütme ayarıyla GPT‑6 Astra’ya bağlandığında uçtan uca sesli ajan zekâsını ölçen Tau3 değerlendirmesinde birinci sırada yer aldı. Açıklamada farklı testlerin müşteri hizmetleri görevleri, bilgi getirme ve hesap araçlarıyla bankacılık desteği, duraklamalar, kesintiler, arka plan konuşmaları, yanıt başlatma süresi ve sesli araç kullanımı gibi alanları ölçtüğü aktarılıyor.
Bu sonuçlar OpenAI’nin değerlendirmelerine dayanıyor. Modelin görev başarısı, seçilen arka uç modeli ve kullanılan araçlara göre değişebiliyor; şirket de ses katmanının yanında farklı iş yükleri için farklı model ve araçların seçilebileceğini vurguluyor.
Telefon görüşmeleri ve yeni ses seçenekleri
GPT‑Live‑1, telefon görüşmeleri için tam çift yönlü sesli ajanların kurulmasını da destekliyor. OpenAI, restoran rezervasyonları ve müşteri desteğini bu kullanım alanlarına örnek olarak sıralıyor. Modelin arka plan gürültüsü, yan konuşmalar ve kesintiler içeren telefon benzeri görüşmelere yönelik konumlandırıldığı görülüyor.
Şirket, gerçek zamanlı ses seçeneklerinin küçük bir kümeden daha geniş bir seçkiye çıkarıldığını da duyurdu. Yeni seçeneklerin aksanlar, lehçeler ve diller arasında geliştiricilere daha fazla tercih sunması amaçlanıyor. OpenAI, ses seçenekleri ile dil kullanılabilirliğini gelecek aylarda genişletmeye devam edeceğini belirtiyor.
Özel ses erişimi için ise satış ekibiyle görüşülmesi gerekiyor. OpenAI, uygunluk ve başvuru sürecine ilişkin bilginin bu kanal üzerinden alınacağını ifade ediyor.
Fiyatlandırma ve erişim
OpenAI, GPT‑Live‑1’in API’de kullanıma açıldığını ve ön uç ses katmanı için dakika başına 0,05 dolar fiyatlandırıldığını açıkladı. Duyuruda, ses katmanının ürünün ihtiyacına uygun arka uç modeli ve ajan altyapısıyla eşleştirilmesi öneriliyor.
Bu fiyat, açıklamada ön uç ses katmanı için veriliyor. Akıl yürütme, araç kullanımı veya uygulamanın seçtiği arka uç modeline ilişkin maliyetler için duyuruda tek bir birleşik fiyat paylaşılmıyor. Bu nedenle toplam kullanım maliyeti, geliştiricinin kurduğu sesli ajan mimarisine bağlı olacak.
Bir içerik, dört format.
Okumaya vaktin yoksa özetle; paylaşacaksan platforma göre yeniden düzenle.
OpenAI’nin GPT‑Live‑1 modeli, aynı anda dinleme ve konuşma yeteneğiyle sesli ajan geliştirenler için API’de erişime açıldı. Model, kesintileri yönetme, arka plan sesini ele alma ve arka uç modellere görev devretme özellikleriyle duyuruldu. • GPT‑Live‑1 API’de geliştiricilere açıldı • Kesintiler ve eşzamanlı konuşma için tek model yaklaşımı • GPT‑Live‑1 için kontrol ve konuşma ayarları
Bu önizleme yalnızca sayfadaki editoryal veriyi yeniden biçimlendirir. Gerçek yapay zekâ üretimi Core tarafında güvenli bir sunucu endpoint’iyle bağlanacak.




