Nowe narzędzia OpenAI do transkrypcji: tryb offline i na żywo

OpenAI wprowadziło dwa nowe rozwiązania do zamiany mowy na tekst: GPT Transcribe przeznaczone dla gotowych plików audio oraz GPT Live Transcribe do transkrypcji w czasie rzeczywistym. Firma zwraca uwagę m.in. na lepsze rozumienie kontekstu — także przy terminologii technicznej — oraz skuteczność w głośnym otoczeniu.
OpenAI prezentuje nowe rozwiązanieOpenAI prezentuje nowe rozwiązanie
Źródło zdjęć: © Getty Images | SOPA Images
Aleksandra Dąbrowska

Nowe usługi zostały podzielone według sposobu użycia. GPT Transcribe ma służyć do przetwarzania wcześniej nagranych materiałów dźwiękowych, natomiast GPT Live Transcribe ma obsługiwać scenariusze "na bieżąco" — przykładowo wtedy, gdy potrzebne są napisy pojawiające się w trakcie wypowiedzi.

Czym różnią się nowe modele transkrypcji OpenAI

GPT Transcribe rozliczany jest w modelu minutowym, a jego koszt to 0,0045 dol. za minutę. OpenAI podaje, że wyniki benchmarków wskazują na mniejszą liczbę błędów w porównaniu z Whisper-1 oraz dokładniejszy zapis.


WIDEO
Czy ten obiekt to pierwszy odkryty egzoksiężyc? Jest pewien problem


Z kolei GPT Live Transcribe to opcja droższa — wyceniona na 0,017 dol. za minutę. Ten wariant ma być nastawiony przede wszystkim na szybkość przetwarzania mowy na tekst, dlatego celuje w zastosowania, w których kluczowy jest natychmiastowy zapis wypowiedzi.

OpenAI podkreśla odporność na hałas

Według OpenAI oba modele mają lepiej "łapać" sens wypowiedzi, również wtedy, gdy pojawiają się w niej specjalistyczne zwroty. Firma akcentuje też większą odporność na zakłócenia i trudniejsze warunki dźwiękowe.

Jako przykład zaprezentowano transkrypcję w czasie rzeczywistym w trakcie gry na instrumencie muzycznym. Taka demonstracja miała pokazać, że narzędzia potrafią utrzymać wysoką skuteczność nawet przy bardziej wymagającej akustyce.

Wybrane dla Ciebie
NIE WYCHODŹ JESZCZE! MAMY COŚ SPECJALNIE DLA CIEBIE