Modele językowe PLLuM to rozwiązania, które mają odmienić komunikację w języku polskim. Oparte na legalnie pozyskanych danych, PLLuM, mają być bezpieczne i dostosowane do polskiego kontekstu kulturowego. W przyszłości zaś mają usprawnić działania administracji publicznej.
Rozmowa jak z człowiekiem
Modele PLLuM zadebiutowały w lutym 2025 roku. Zostały one zaprojektowane z myślą o bezpieczeństwie i dostosowaniu do specyfiki języka polskiego. Dr hab. Szymon Łukasik z NASK, odpowiedzialny za projekt, podkreśla, że model ma na celu nie tylko generowanie tekstu, ale także ułatwienie przetwarzania języka naturalnego w sposób, który nie wymaga od użytkownika specjalistycznych komend. Dzięki PLLuM komunikacja z maszyną może przypominać dialog z człowiekiem.
Modele PLLuM różnią się od komercyjnych systemów LLM, takich jak ChatGPT czy Gemini, ponieważ zostały zaprojektowane z myślą o specyfice polskiego rynku. Choć trening modeli odbywał się na danych pochodzących z różnych języków, to kluczowym elementem było uwzględnienie polskiej kultury i języka. Z tego względu, wykorzystane dane pochodzą z legalnych źródeł, w tym redakcji prasowych, które wyraziły zgodę na ich użycie.
Bezpieczeństwo danych
Według zapewnień, modele zostały zaprojektowane tak, aby unikały generowania nielegalnych, nieprawdziwych lub kontrowersyjnych treści, co ma ogromne znaczenie zwłaszcza w kontekście ich zastosowania w administracji publicznej. W tym celu, zespół projektu wykorzystał najnowsze standardy ochrony danych, a także przeprowadził dokładne szkolenia w zakresie etycznego podejścia do tworzenia AI.
Prace nad PLLuM są częścią większego projektu pod nazwą HIVE, który ma na celu współpracę wielu badaczy i inżynierów z różnych instytucji. Modele PLLuM zostały już udostępnione publicznie – w wersjach zarówno lekkich, dostępnych dla programistów, jak i bardziej zaawansowanych, przeznaczonych dla zastosowań badawczych.
Czytaj także: