Gdy model AI uczy się dialektu i kultury. Co to zmienia w obsłudze obywatela
Nie każdy model znający arabski rozumie Emiratczyka. Brzmi jak oczywistość, a jednak przez lata branża AI działała odwrotnie: jeden duży model, dużo języków, jakoś to będzie. Teraz to się zmienia. Pojawiają się modele trenowane nie po prostu na „arabskim" czy „polskim", lecz na konkretnym dialekcie, prawodawstwie, zwrotach urzędowych i kulturowych niuansach danego regionu. Różnica między takim modelem a ogólnym tłumaczem bywa kolosalna w kontekście publicznym, gdzie jedno źle zrozumiane słowo może zmienić sens decyzji administracyjnej.
Chodzi o coś więcej niż poprawną gramatykę. Model naprawdę wychowany na lokalnym kontekście wie, że konkretny zwrot może oznaczać coś innego w piśmie urzędowym niż w rozmowie potocznej. Rozumie lokalne odniesienia prawne, hierarchię pojęć i rejestr, w jakim należy odpowiedzieć. To nie jest feature, który da się dokleić promptem.
Co to oznacza dla polskich urzędów i instytucji publicznych
Polska ma swój własny „dialekt urzędowy". Kodeks postępowania administracyjnego, ustawa o dostępie do informacji publicznej, RODO w polskiej implementacji, nomenklatura ZUS, NFZ, PESEL, NIP. Ogólny model językowy, nawet bardzo dobry, radzi sobie z tym przeciętnie. Model dotrenowany na polskich aktach prawnych, orzecznictwie NSA i realnych pismach urzędowych to zupełnie inna jakość odpowiedzi.
Drugi wątek to obsługa mniejszości i nowych mieszkańców. W Polsce mieszka dziś kilkaset tysięcy Ukraińców, sporo z nich to stali rezydenzi korzystający z usług publicznych. Są też społeczności śląska, Kaszubi, mniejszość niemiecka. Model, który zna tylko standardowy polski i standardowy ukraiński, nie wyłapie wszystkich niuansów. To realne ryzyko błędu przy tłumaczeniu pism, wyjaśnianiu procedur czy obsłudze chatbotów na portalach urzędowych.
- Weryfikacja jakości modeli przed wdrożeniem: zanim urząd wdroży asystenta AI do obsługi dokumentów, warto sprawdzić, na jakich danych był trenowany. Czy uwzględniał polskie prawo administracyjne, czy tylko ogólny korpus internetowy?
- Dotrenowanie na własnych danych: instytucje z dużymi zbiorami własnych dokumentów mają dziś realną możliwość dotrenowania modelu na swoim piśmiennictwie. Nie trzeba zaczynać od zera.
- Obsługa wielojęzyczna nie równa się wielokulturowa: chatbot tłumaczący na ukraiński to nie to samo, co chatbot rozumiejący, jak ukraiński urzędnik myśli o procedurze meldunkowej. Różnica wychodzi przy pierwszym nieoczekiwanym pytaniu.
Trend lokalnych, wyspecjalizowanych modeli rośnie i nie jest domeną tylko bogatych państw z własną infrastrukturą. Coraz częściej wystarczy dotrenować istniejący model bazowy na własnym zbiorze danych. To staje się dostępne nawet dla średniej wielkości instytucji publicznej, bez wielomilionowych budżetów.
Jeśli zastanawiasz się, czy wasz urząd korzysta z modeli dopasowanych do polskiego kontekstu prawnego i językowego, albo czy jest jeszcze pole do poprawy, zapraszamy na bezpłatny audyt. Sprawdzimy, co realnie działa, a co tylko wygląda jak AI.
Opracowanie: zespół redAi z wykorzystaniem narzędzi AI.
Więcej aktualności
- Jak tokenizer wpływa na koszty i jakość AI w polskim urzędzie
- Środowiska do uczenia agentów stają się zasobem wspólnym. Co to zmienia dla instytucji, które chcą trenować własne systemy
- Agent powiedział, że skończył. Baza danych miała inne zdanie.
- Kiedy społeczność open source staje się częścią infrastruktury. Co to zmienia dla urzędów z Apple Silicon