Aktualności
Badania
01 Czerwca
Źródło: Adobe Stock
Opublikowano: 2026-06-01

Powstało narzędzie do tworzenia bezpiecznych modeli mowy

Międzynarodowy zespół naukowców zbudował VOICY – narzędzie do tworzenia bezpiecznych modeli mowy generowanych przez AI. Bezpiecznych, tzn. eliminujących ryzyko  nadużywania lub kradzieży naszych danych biometrycznych. Jednym z liderów projektu był prof. Edward Szczerbicki z Politechniki Gdańskiej.

Sztuczna inteligencja potrafi już tworzyć realistyczną mowę, która brzmi dokładnie tak jak u prawdziwej osoby, wykorzystując zaledwie kilka sekund nagrania z jej udziałem. Choć technologia ta jest ekscytująca, większość obecnych narzędzi wymaga przesyłania prywatnych nagrań głosowych na serwery w chmurze, co stwarza ryzyko nadużywania lub kradzieży naszych danych biometrycznych.

Aby rozwiązać ten problem, międzynarodowy zespół naukowców pod kierownictwem prof. Edwarda Szczerbickiego z Politechniki Gdańskiej oraz prof. Cesara Sanina z The University of New England w Sydney zbudował VOICY. To narzędzie działające wyłącznie na prywatnym komputerze, co oznacza, że dane głosowe nigdy nie opuszczają naszego urządzenia. VOICY pozwala albo natychmiast sklonować głos z krótkiego nagrania, albo wytrenować niestandardowy model na wyższą jakość na podstawie własnych danych. Stworzono też zautomatyzowany system, który zajmuje się wszystkimi technicznymi aspektami, takimi jak regulacja głośności i transkrypcja dźwięku, więc nie trzeba robić tego ręcznie. Dzięki wykorzystaniu VOICY, badacze, twórcy i profesjonaliści pracujący głosem mogą osiągnąć bezkompromisowy realizm mowy, jednocześnie chroniąc swoje dane głosowe i robić to pod własną kontrolą.

W miarę jak głosy generowane przez AI stają się coraz powszechniejsze, rośnie ryzyko „deepfake’ów” i nieautoryzowanego wykorzystania tożsamości ludzi. Obecne usługi „czarnej skrzynki” często pozbawiają użytkowników kontroli nad własnymi identyfikatorami biometrycznymi. VOICY jest ważny, ponieważ udowadnia, że nie musimy wybierać między wysokiej jakości dokonaniami AI a prywatnością danych – przekonują badacze.

Narzędzie zapewnia przejrzystą, bezpieczną i łatwą w użyciu platformę, która umożliwia każdemu – od niezależnych badaczy po małe zespoły – tworzenie własnych modeli mowy bez potrzeby drogiego sprzętu czy dostępu do ryzykownych usług chmurowych. Dzięki działaniu wyłącznie offline, VOICY pomaga wyznaczyć nowy, odpowiedzialny standard dla przyszłości dźwięku generatywnego. Proponowany system łączy elastyczność klonowania „zero-shot” ze stabilnością i wiernością precyzyjnie dostrojonych modeli, oferując rozwiązanie hybrydowe wspierające zarówno szybkie eksperymenty, jak i profesjonalne modelowanie głosu. Tryb „zero-shot” umożliwia natychmiastową syntezę z krótkich próbek referencyjnych, natomiast precyzyjne strojenie za pomocą LoRA (Low-Rank Adaptation) pozwala na głębszą adaptację unikalnych cech wokalnych mówiącego, przy użyciu ograniczonych zasobów obliczeniowych. To dwumodowe rozwiązanie gwarantuje, że VOICY jest nie tylko wydajne i skalowalne, ale także nadaje się do wdrożenia w środowiskach krytycznych dla prywatności.

Naszym zdaniem obecny „paradoks prywatności” w AI, gdzie jesteśmy zmuszeni wymienić nasze bezpieczeństwo na wygodę, jest nie do utrzymania. Naszym celem przy tworzeniu VOICY było przekazanie „władzy” użytkownikowi. Uważamy, że każdy, kto pracuje z wrażliwymi danymi głosowymi, czy to w sprawach medycznych, projektach prawnych, czy projektach osobistych, powinien móc korzystać z najnowszych osiągnięć AI bez obawy o wykorzystanie swoich danych. To nasz wkład w bardziej etyczną, przejrzystą społeczność AI, gdzie oprogramowanie jest tworzone głównie z myślą o bezpieczeństwie, a nie tylko z potrzeby i konieczności – wyjaśnia prof. Edward Szczerbicki.

Rozwiązanie zaprezentowano na ACM Web Conference 2026 w Dubaju. To jedno z najważniejszych wydarzeń w obszarze „Applicable AI”.

MK

Dyskusja (1 komentarz)
  • ~Antoni 30.06.2026 23:32

    Czyli trenujemy na własnym komputerze nagrywamy wykład publikujemy na YT i modlimy się żeby ktoś naszego głosu nie wykorzystał? W czym miałoby to narzędzie pomóc skoro wystarczy próba głosu do trenowania AI?