AI Lab działający w Ośrodku Przetwarzania Informacji opracował i udostępnił model EuroDense, przeznaczony do wyszukiwania informacji w dziewięciu popularnych językach europejskich. To pierwsze wielojęzyczne rozwiązanie tego typu stworzone przez zespół badawczy OPI.
Rosnąca popularność systemów opartych na generatywnej sztucznej inteligencji, które wykorzystują dane dziedzinowe, powoduje wzrost znaczenia technologii wyszukiwania informacji. Jakość odpowiedzi generowanych przez modele językowe coraz częściej zależy od skuteczności mechanizmów odnajdywania właściwych dokumentów i źródeł wiedzy. Właśnie dlatego AI Lab OPI rozwija zaawansowane modele typu dense retriever, które umożliwiają wyszukiwanie treści na podstawie ich znaczenia, a nie jedynie dopasowania słów kluczowych.
Nowy model EuroDense, który powstał w naszym instytucie, wspiera dziewięć języków europejskich: polski, angielski, niemiecki, francuski, hiszpański, włoski, portugalski, niderlandzki oraz rosyjski. Model liczy 435 mln parametrów i obsługuje kontekst o długości do 8192 tokenów, co pozwala skutecznie analizować także dłuższe dokumenty – opisuje dr inż. Marek Kozłowski, kierownik AI Lab w Ośrodku Przetwarzania Informacji. – W kategorii modeli wielojęzycznych posiadających mniej niż 1 miliard parametrów EuroDense osiągnął najlepsze rezultaty w siedmiu z dziewięciu języków oraz uzyskał najwyższy średni wynik NDCG@10 zarówno w ujęciu językowym, jak i zadaniowym – dodaje.
Choć na rynku dostępnych jest wiele zaawansowanych modeli dla języka angielskiego, znacznie mniej rozwiązań oferuje równie wysoką jakość dla pozostałych języków europejskich. EuroDense powstał właśnie po to, aby wypełnić tę lukę. To jednocześnie pierwszy model językowy opracowany w AI Lab, który wykracza poza domenę języka polskiego.
Trening na 200 milionach tekstów
EuroDense został wytrenowany w trzystopniowym procesie obejmującym dwa etapy destylacji wiedzy oraz etap dostrajania modelu. Na potrzeby treningu przygotowano wielojęzyczny korpus obejmujący około 200 milionów tekstów. Szczególny nacisk położono na zachowanie wysokiej jakości reprezentacji semantycznych we wszystkich obsługiwanych językach, co pozwala modelowi skutecznie realizować zadania wyszukiwania informacji i wspierać aplikacje wykorzystujące architekturę RAG (Retrieval Augmented Generation).
RAG pozwala połączyć duży model językowy z zewnętrznymi źródłami wiedzy, np. dokumentami i bazami danych organizacji. Dzięki temu odpowiedzi mogą się opierać na aktualnych i zweryfikowanych informacjach, których model nie miał w swoich danych treningowych. Jak wskazuje Komisja Europejska, takie rozwiązanie może zwiększać dokładność odpowiedzi, ograniczać generowanie treści niepopartych źródłami i umożliwiać wskazywanie źródeł bez konieczności ponownego trenowania modelu.
Staraliśmy się adresować ten model pod kątem tych języków, które są najczęściej używane w kontynentalnej Europie. Planujemy rozwijać model o kolejne języki. Potrzeby w zakresie rozwoju tych technologii językowych są olbrzymie – wskazuje kierownik AI Lab OPI-PIB.
Rozwój własnych modeli językowych jest częścią szerszych działań Europy na rzecz zmniejszenia dystansu do światowych liderów AI. Według Stanford AI Index 2026 w 2025 roku prywatne inwestycje w generatywną AI w Stanach Zjednoczonych sięgnęły 285,9 mld dol., wobec 20,9 mld dol. w Europie. Z danych za 2024 rok wynika, że amerykańskie instytucje stworzyły 40 znaczących modeli AI, podczas gdy europejskie łącznie trzy.
Model EuroDense został udostępniony jako rozwiązanie open source na platformie Hugging Face. Dzięki temu może być wykorzystywany przez instytucje naukowe, administrację publiczną oraz przedsiębiorstwa do budowy wielojęzycznych systemów wyszukiwania informacji, inteligentnych baz wiedzy i nowoczesnych aplikacji AI.
MK, źródło: OPI