Transkrypcja nagrań tanieje o siedemdziesiąt procent w pół roku. Co to zmienia w administracji

📰 2026-09-27 · 3 min czytania

Ceny automatycznej transkrypcji audio właśnie zrobiły coś nieoczekiwanego. Jeden z czołowych dostawców wypuścił model rozpoznawania mowy w cenie dziesięciu centów za godzinę nagrania. Jego poprzednia wersja, dostępna zaledwie pięć miesięcy wcześniej, kosztowała ponad trzydzieści sześć centów. Spadek o ponad siedemdziesiąt procent. Organizacja przetwarzająca sto tysięcy godzin nagrań rocznie zapłaciłaby dawniej trzydzieści sześć tysięcy dolarów, teraz dziesięć. Transkrypcja przestaje być pozycją, o którą ktokolwiek w ogóle się spiera.

Za tym ruchem stoi strategia, którą warto rozumieć. Duży producent oprogramowania, zamiast kupować usługi rozpoznawania mowy od zewnętrznych partnerów, buduje własne modele kolejnych modalności. Transkrypcja jest tą, gdzie ten plan posunął się najdalej. Efekt: ceny lecą w dół, jakość rośnie. To nie jednorazowy ruch cenowy. To sygnał kierunku całego segmentu.

Co to oznacza dla polskich urzędów i instytucji publicznych

Polskie instytucje publiczne nagrywają znacznie więcej niż myślą. Sesje rad gmin, posiedzenia komisji, przesłuchania, narady, infolinie obywatelskie. Część tych nagrań trafia do archiwum i nigdy nie zostaje przepisana, bo koszt manualnej transkrypcji był nieproporcjonalny do korzyści. Ta kalkulacja właśnie się odwróciła. Przy kilku groszach za minutę nagrania przetworzenie rocznego archiwum jednego urzędu to budżet mniejszy niż pojedyncze zlecenie zewnętrzne.

Jest też wątek dostępności. Przepisy o dostępności cyfrowej wymagają, żeby treści audio i wideo były dostępne dla osób niesłyszących. W praktyce napisy do nagrań z sesji rady albo z konferencji prasowej to nadal rzadkość. Powód był prosty: czas i pieniądze. Przy obecnych cenach transkrypcji ten argument przestaje obowiązywać. Automatyczny tekst z modelu, poddany krótkiej redakcji, wypełnia obowiązek ustawowy i przy okazji poprawia wyszukiwalność treści w archiwum.

Zanim jednak ktoś zacznie masowo wysyłać nagrania do chmury, warto zatrzymać się na chwilę. Nagrania posiedzeń często zawierają dane osobowe, numery PESEL wymawiane głośno przy mównicach, informacje z postępowań administracyjnych. Wysyłka takich plików audio do zewnętrznego API bez oceny ryzyka zgodności z RODO to błąd. Część nagrań powinna być przetwarzana w środowisku odpowiadającym klasyfikacji danych instytucji. Modele do transkrypcji on-premises istnieją i są coraz bardziej dojrzałe. Droższe od chmury, ale i tak tańsze niż rok temu.

Osobna kwestia to dokładność dla języka polskiego. Większość benchmarków opiera się na angielskim. Polskie akcenty regionalne, nazwy własne i terminologia urzędowa bywają wyzwaniem nawet dla modeli z dobrymi wynikami ogólnymi. Przed wdrożeniem produkcyjnym wystarczy przetestować model na próbce własnych nagrań. Kilka godzin testów oszczędza miesięcy kłopotów.

Jeśli zastanawiają się Państwo, jak wdrożyć transkrypcję AI w swojej instytucji bez ryzyka związanego z danymi osobowymi, zapraszamy na bezpłatny audyt. Razem ocenimy, które procesy zyskają najwięcej i jak to zrobić bezpiecznie.

Opracowanie: zespół redAi z wykorzystaniem narzędzi AI.

Więcej aktualności