Microsoft VibeVoice-ASR’ı piyasaya sürdü.

Microsoft, açık kaynaklı öncü ses yapay zekâ modelleri ailesi VibeVoice’ın bir parçası olarak VibeVoice-ASR’ı piyasaya sürdü. VibeVoice-ASR, 60 dakikalık uzun ses kayıtlarını tek seferde işleyebilen ve Kim, Ne Zaman ve Ne bilgilerini kodlayan yapılandırılmış transkripsiyonlar üretebilen, özelleştirilmiş anahtar kelimeleri destekleyen birleşik bir konuşmadan metne dönüştürme modeli olarak tanımlanıyor.

VibeVoice, MIT lisansı altında Metin-Konuşma, gerçek zamanlı TTS ve Otomatik Konuşma Tanıma modellerini barındıran tek bir depoda yer almaktadır . VibeVoice, 7,5 Hz hızında çalışan sürekli konuşma belirteçleyicileri ve büyük bir Dil Modeli’nin metin ve diyalog üzerinde akıl yürüttüğü ve bir difüzyon başlığının akustik ayrıntı ürettiği bir sonraki belirteç difüzyon çerçevesi kullanır. Bu çerçeve esas olarak TTS için belgelenmiştir, ancak VibeVoice-ASR’nin içinde bulunduğu genel tasarım bağlamını tanımlar.

Tek bir küresel bağlamla uzun biçimli otomatik konuşma tanıma (ASR)

Geleneksel otomatik konuşma tanıma (ASR) sistemlerinin aksine, önce sesi kısa parçalara bölen ve ardından ayrı bileşenler olarak konuşmacı ayrıştırma ve hizalama işlemlerini gerçekleştiren VibeVoice-ASR, 64K token uzunluğu bütçesi dahilinde 60 dakikaya kadar kesintisiz ses girişi kabul edecek şekilde tasarlanmıştır. Model, tüm oturumun tek bir küresel temsilini korur. Bu, modelin her birkaç saniyede bir sıfırlanmak yerine, konuşmacı kimliğini ve konu bağlamını tüm saat boyunca koruyabileceği anlamına gelir.

60 Dakikalık Tek Geçişli İşlem

İlk önemli özellik , birçok geleneksel ASR sisteminin uzun ses kayıtlarını kısa parçalara bölerek işlemesi ve bu durumun genel bağlamı kaybetmesine yol açmasıdır. VibeVoice-ASR ise bunun yerine 64K’lık bir pencere içinde 60 dakikaya kadar kesintisiz ses kaydı alarak, tüm kayıt boyunca tutarlı konuşmacı takibi ve anlamsal bağlamı koruyabilir.

Bu, toplantı transkripsiyonu, dersler ve uzun destek görüşmeleri gibi görevler için önemlidir. Tüm dizinin tek bir geçişte işlenmesi, süreci basitleştirir. Kısmi hipotezleri birleştirmek veya ses parçaları arasındaki sınırlarda konuşmacı etiketlerini onarmak için özel mantık uygulamaya gerek yoktur.

Alan adı doğruluğu için özelleştirilmiş anahtar kelimeler

İkinci önemli özellik ise özelleştirilmiş anahtar kelimelerdir . Kullanıcılar ürün adları, kuruluş adları, teknik terimler veya arka plan bağlamı gibi anahtar kelimeler sağlayabilirler. Model, tanıma sürecini yönlendirmek için bu anahtar kelimeleri kullanır.

Bu, modeli yeniden eğitmeden, alana özgü belirteçler için doğru yazım ve telaffuza yönelik kod çözme işlemini yönlendirmenizi sağlar. Örneğin, bir geliştirici kullanıcı, çıkarım aşamasında dahili proje adlarını veya müşteriye özgü terimleri geçirebilir. Bu, benzer akustik koşulları paylaşan ancak çok farklı kelime dağarcıklarına sahip çeşitli ürünlerde aynı temel modeli kullanırken faydalıdır.

Microsoft ayrıca VibeVoice-ASR için finetuning-asr LoRA tabanlı ince ayar komut dosyaları içeren bir dizin de sunmaktadır . Anahtar kelimeler ve LoRA ince ayarı birlikte, hem hafif uyarlama hem de daha derin alan uzmanlaşması için bir yol sağlar.

Zengin Transkripsiyon, günlükleştirme ve zamanlama

Üçüncü özellik ise Kim, Ne Zaman ve Ne bilgilerini içeren Zengin Transkripsiyon’dur. Model, otomatik konuşma tanıma (ASR), kişi sözlüğüne göre seslendirme (diarizasyon) ve zaman damgalama işlemlerini birlikte gerçekleştirir ve kimin neyi ne zaman söylediğini gösteren yapılandırılmış bir çıktı döndürür.

Aşağıda DER, cpWER ve tcpWER olarak adlandırılan üç değerlendirme rakamı yer almaktadır.

  • DER (Diarizasyon Hata Oranı), modelin konuşma bölümlerini doğru konuşmacıya ne kadar iyi atadığını ölçer.
  • cpWER ve tcpWER, konuşma ortamında hesaplanan kelime hata oranı ölçütleridir.

Bu grafikler, bu ASR sisteminin birincil hedef ayarı olan çok konuşmacılı uzun metin verilerinde modelin ne kadar iyi performans gösterdiğini özetlemektedir.

Yapılandırılmış çıktı formatı, konuşmacıya özel özetleme, eylem maddesi çıkarma veya analitik panolar gibi sonraki işlemler için oldukça uygundur. Bölümler, konuşmacılar ve zaman damgaları zaten tek bir modelden geldiği için, sonraki kodlar transkripti zamana göre hizalanmış bir olay günlüğü olarak ele alabilir.

Önemli Noktalar

  • VibeVoice-ASR, 64K belirteçlik bir bağlam içinde 60 dakikalık ses kayıtlarını tek geçişte işleyen birleşik bir konuşmadan metne dönüştürme modelidir.
  • Model, otomatik konuşma tanıma (ASR), konuşmacı ayrıştırma ve zaman damgalama işlemlerini birlikte gerçekleştirerek, tek bir çıkarım adımında Kim, Ne Zaman ve Ne bilgilerini kodlayan yapılandırılmış transkriptler üretir.
  • Özelleştirilmiş Anahtar Kelimeler, kullanıcıların modelin yeniden eğitilmesine gerek kalmadan tanıma doğruluğunu artırmak için ürün adları veya teknik jargon gibi alana özgü terimleri eklemelerine olanak tanır.
  • DER, cpWER ve tcpWER ile yapılan değerlendirme, modeli toplantılar, dersler ve uzun telefon görüşmeleriyle uyumlu hale getiren çok konuşmacılı konuşma senaryolarına odaklanmaktadır.
  • VibeVoice-ASR, resmi ağırlıklar, ince ayar komut dosyaları ve denemeler için çevrimiçi bir Oyun Alanı ile birlikte MIT lisansı altında VibeVoice açık kaynak yığını içinde yayınlanmıştır.

Kaynak: Marktechpost.com