AI LAB działający w Ośrodku Przetwarzania Informacji udostępnił nowoczesną rodzinę neuronowych modeli językowych Polish ModernBERT. Rozwiązanie zostało opracowane w ramach projektu Gaia AI Factory i jest dostępne bezpłatnie dla naukowców, administracji publicznej oraz biznesu. Nowe modele pozwalają semantycznie analizować zarówno krótkie teksty, jak i obszerne dokumenty w języku polskim, obsługując kontekst o długości nawet 8192 tokenów.
Polish ModernBERT to nowa generacja modeli reprezentacyjnych (typu encoder-only) przeznaczonych do wydajnej realizacji zadań związanych z rozumieniem języka naturalnego, takich jak klasyfikacja tekstów, rozpoznawanie nazw własnych, regresja czy zadania z obszaru wyszukiwania informacji. Modele zostały wytrenowane na specjalnie przygotowanym polskim korpusie obejmującym kilkadziesiąt mld tokenów. Zespół AI LAB opracował cały proces uczenia, od przygotowania wysokiej jakości danych treningowych po autorskie wieloetapowe procedury pretreningu.
Udostępniono cztery warianty modeli: Base i Large, dostępne zarówno dla kontekstu 512 tokenów, jak i 8 tys. tokenów. W przeprowadzonych ewaluacjach model Large-8K osiągnął wynik 85,11 punktów, stając się najlepiej ocenionym polskim modelem reprezentacyjnym wśród porównywalnych rozwiązań.
Jak podkreślają twórcy, nowe modele mają wspierać rozwój polskich technologii AI oraz zwiększać dostępność zaawansowanych narzędzi językowych dla szerokiego grona użytkowników. Warianty Base mogą działać również na procesorach CPU, co ułatwia ich wdrażanie w instytucjach publicznych i przedsiębiorstwach bez rozbudowanej infrastruktury obliczeniowej i dysponowania kartami graficznymi.
Polish ModernBERT to kolejny rezultat prac AI LAB OPI w 2026 roku. W ostatnich miesiącach zespół udostępnił również modele dedykowane wyszukiwaniu informacji – PolDense i EuroDense oraz narzędzie PUMA, rozwijając portfolio otwartych technologii językowych dla języka polskiego i innych języków europejskich.
Projektując Polish ModernBERT chcieliśmy stworzyć modele, które będą jednocześnie skuteczne, wydajne i łatwe do zastosowania w praktyce. Szczególny nacisk położyliśmy na minimalizację rozmiaru przy niewielkiej stracie jakości oraz na możliwość pracy z długimi dokumentami, ponieważ właśnie takie zasoby dominują w administracji, nauce czy sektorze regulowanym. Otwarty dostęp do modeli oznacza, że każdy może wykorzystać je do budowy własnych aplikacji, potoków analizy dokumentów, systemów analitycznych czy innych rozwiązań opartych na AI –mówi dr inż. Marek Kozłowski, kierownik AI LAB OPI.
Polish ModernBERT powstał w projekcie Gaia AI Factory, współfinansowanym przez Wspólne Przedsięwzięcie EuroHPC ze środków programu Unii Europejskiej „Cyfrowa Europa”. Obliczenia wykonano z wykorzystaniem infrastruktury PLGrid w Akademickim Centrum Komputerowym Cyfronet AGH.
Czym jest PUMA?
AI LAB OPI rozwija również narzędzia służące do oceny jakości nowoczesnych multimodalnych modeli sztucznej inteligencji. Jednym z nich jest PUMA (Polish Unified Multimodal Assessment) – aplikacja, która pozwoliła stworzyć benchmark umożliwiający kompleksową ocenę zdolności modeli do rozumienia treści tekstowych, graficznych, dźwiękowych i dokumentowych w polskim ujęciu językowym i kulturowym. Obejmuje on 900 ręcznie przygotowanych zadań w dziewięciu kategoriach, sprawdzających m.in. rozumienie polskiej historii, kultury i geografii, transkrypcję oraz interpretację nagrań audio, a także analizę skanów dokumentów, ekstrakcję z nich kluczowych danych i odpowiadanie na pytania dotyczące ich zawartości. PUMA weryfikuje nie tylko wiedzę modeli o Polsce, ale także ich praktyczne kompetencje istotne dla biznesu i administracji, takie jak OCR, analiza tabel, infografik czy ASR. Dzięki temu stanowi ważny element ekosystemu otwartych rozwiązań AI rozwijanych przez AI LAB OPI, obok modeli językowych takich jak Polish ModernBERT.
Aplikacja, która pozwoliła zespołowi zbudować benchmarki multimodalności dla języka polskiego jest otwartym narzędziem z angielskim interfejsem, dzięki czemu można go wdrażać w innych państwach UE. PUMA została sfinansowana ze środków projektu „Duże modele językowe dla Unii Europejskiej (LLMs4EU)” (konsorcjum ALT-EDIC), realizowanego w ramach programu Komisji Europejskiej „Cyfrowa Europa” oraz środków Ministerstwa Cyfryzacji.
Narzędzia od OPI dostępne za darmo
Modele są dostępne publicznie na platformie Hugging Face, a szczegóły ich architektury, procesu treningu i wyników ewaluacji opisano w publikacji naukowej. Na platformie Hugging Face dostępny jest również publiczny leaderboard PUMA.
źródło: OPI