
Vishing połączony z klonowaniem głosu przez sztuczną inteligencję stanowi obecnie jedno z najbardziej niebezpiecznych zagrożeń dla oszczędności polskich rodzin. Przestępcy potrafią wygenerować łudząco podobny głos syna, córki lub wnuka na podstawie zaledwie kilku sekund nagrania pobranego z mediów społecznościowych. Najskuteczniejszą metodą obrony przed wyłudzeniem pieniędzy jest ustalenie prostego, poufnego rodzinnego hasła bezpieczeństwa. Pozwala ono w kilka sekund zweryfikować tożsamość dzwoniącego podczas rzekomego wypadku czy nagłej potrzeby finansowej.
Vishing (voice phishing) to odmiana oszustwa internetowego wykorzystująca połączenia telefoniczne i socjotechnikę do wyłudzania pieniędzy lub danych osobowych. Klonowanie głosu przez sztuczną inteligencję polega na wytrenowaniu algorytmu syntezy mowy na krótkiej próbce audio, co umożliwia przestępcom generowanie dowolnych wypowiedzi brzmiących identycznie jak głos konkretnej osoby.
Rozwój generatywnych modeli językowych sprawił, że narzędzia do konwersji tekstu na mowę (Text-to-Speech) stały się powszechnie dostępne. Przestępcom wystarczy krótki fragment wideo opublikowany na TikToku, Instagramie czy serwisie YouTube, na którym potencjalna ofiara mówi wyraźnie przez kilka sekund. Algorytm analizuje barwę, tembr, akcent i intonację mowy, a następnie buduje cyfrowy profil głosowy.
W połączeniu z technologią Caller ID Spoofing – pozwalającą na sfałszowanie numeru wyświetlającego się na ekranie telefonu odbiorcy – oszuści potrafią wywołać wrażenie, że połączenie przychodzi bezpośrednio od najbliższego członka rodziny.
Oszuści wykorzystują próbki audio z sieci, aby wygenerować głos bliskiej osoby i wyłudzić pieniądze.
Atak wykorzystujący sklonowany głos opiera się na wywołaniu u ofiary paraliżującego stresu, silnych emocji i natychmiastowej presji czasu. Oszuści najczęściej symulują sytuację zagrożenia życia, potrącenie pieszego na przejściu lub nagłe zatrzymanie przez policję, żądając błyskawicznego przekazania pieniędzy na kaucję.
Scenariusz przebiega według powtarzalnego schematu. Telefon dzwoni w godzinach wieczornych lub w trakcie intensywnego dnia pracy. Na ekranie pojawia się napis „Córka Kasia” lub znany numer telefonu. Po odebraniu słychać zapłakany, przerażony głos: „Mamo, stało się coś strasznego, potrąciłam kobietę, jestem w komisariacie, zaraz zabiorą mi telefon! Potrzebuję 30 000 zł na kaucję, zaraz przekażę telefon mecenasowi”.
Mózg odbiorcy w warunkach ekstremalnego stresu odrzuca krytyczne myślenie. Zrozpaczony rodzic nie analizuje drobnych niuansów językowych, lecz natychmiast skupia się na chęci udzielenia pomocy swojemu dziecku. Chwilę później słuchawkę przejmuje fałszywy adwokat lub policjant, który podaje instrukcje dotyczące wykonania szybkiego przelewu, przekazania kodów BLIK lub oddania gotówki kurierowi.
Klasyczny vishing opiera się na grze aktorskiej oszusta udającego krewnego, podczas gdy AI voice phishing wykorzystuje cyfrową syntezę mowy do idealnego odwzorowania barwy głosu ofiary. Różnica ta sprawia, że atak z użyciem sztucznej inteligencji oszukuje nawet bardzo czujne osoby.
W redakcji BigPortal zestawiliśmy kluczowe cechy obu metod wyłudzeń telefonicznych.
| Cecha ataku | Klasyczny vishing (metoda „na wnuczka”) | AI Voice Phishing (klonowanie mowy) |
| Sposób generowania głosu | Żywy oszust zmieniający głos lub szlochający | Algorytm AI trenowany na próbce audio z sieci |
| Poziom realizmu dźwięku | Niski do średniego (łatwo wykryć obcy akcent) | Ekstremalnie wysoki (idealna barwa i intonacja) |
| Wymagane przygotowanie | Wybór losowego numeru z książki telefonicznej | Pobranie nagrania z profilu w mediach społecznościowych |
| Pretekst połączenia | Wypadek, okazja inwestycyjna, tajna akcja policji | Nagły przypadek losowy, kaucja, szpital |
| Narzędzie obrony | Weryfikacja faktów, zadanie pytania pomocniczego | Rodzinne hasło ratunkowe, rozłączenie się |
Rodzinne hasło ratunkowe to poufna fraza lub odpowiedź na niestandardowe pytanie, uzgodniona ustnie pomiędzy wszystkimi członkami rodziny na wypadek sytuacji awaryjnych. Służy do natychmiastowej weryfikacji tożsamości dzwoniącego, odróżniając prawdziwego krewnego od sklonowanego głosu AI.
Skuteczny system weryfikacji rodzinnej wymaga przestrzegania czterech prostych zasad podczas jego tworzenia:
[Podejrzany telefon z prośbą o pieniądze] ---> Pytanie o rodzinne hasło ---> Brak poprawnej odpowiedzi ---> Rozłączenie połączenia
Po odebraniu telefonu z żądaniem pieniędzy należy powstrzymać emocje, zażądać podania rodzinnego hasła ratunkowego i bezwzględnie przerwać połączenie. Jedynym skutecznym sposobem na zweryfikowanie bezpiecznej sytuacji jest samodzielny telefon pod znany numer z własnej książki adresowej.
Jeśli znajdziesz się w takiej sytuacji, zastosuj poniższy schemat działania:
incydent.cert.pl lub wyślij wiadomość SMS z opisem zdarzenia pod bezpłatny numer 8080.
Ograniczenie widoczności nagrań wideo i wiadomości głosowych w publicznych profilach społecznościowych znacząco zmniejsza ryzyko pozyskania próbki głosu przez cyberprzestępców. Przegląd ustawień prywatności na kontach dzieci i nastolatków to podstawowy krok w ochronie całej rodziny przed atakami ukierunkowanymi.
Warto pouczyć najmłodszych domowników, aby nie publikowali rolek czy relacji z otwartym dostępem dla wszystkich użytkowników sieci. Zmiana statusu profilu na prywatny na Instagramie czy TikTok utrudnia oszustom masowe zbieranie prób dźwiękowych. Dodatkowo warto wdrożyć zasadę, by podczas odbierania połączeń z nieznanych numerów nie zaczynać rozmowy od długich, skomplikowanych zdań. Chcesz uchronić swoich bliskich przed nowymi metodami cyberprzestępców? Zobacz nasze pozostałe poradniki w dziale Cyberbezpieczeństwo w BigPortal.
Badania nad bezpieczeństwem biometrycznym pokazują, że do stworzenia realistycznego klonu głosu o skuteczności rozpoznawania powyżej 85% wystarczy zaledwie 3-sekundowe nagranie czystej mowy pobrane z relacji w mediach społecznościowych. Zarazem aż 92% osób starszych deklaruje, że nie potrafi odróżnić głosu wygenerowanego przez AI od mowy własnego wnuka. [źródło: Badanie CERT Polska & NASK, 2025]
Vishing to oszustwo prowadzone przez połączenia telefoniczne, w którym przestępca wykorzystuje głos i manipulację psychologiczną. Tradycyjny phishing opiera się na fałszywych wiadomościach e-mail lub SMS zawierających niebezpieczne linki.
Przestępcy pobierają krótkie nagrania wideo z publicznych profilów na TikToku, Instagramie, Facebooku czy YouTube. Czasami wykorzystują nagrania z poczty głosowej lub wykonują krótki telefon głuchy, narywając odpowiedź ofiary.
Tak, pozwala na to technologia Caller ID Spoofing. Oszuści podszywają się pod dowolny numer telefonu, przez co smartfon odbiorcy automatycznie dopasowuje go do kontaktu zapisanego w książce telefonicznej i wyświetla przypisaną nazwę.
Bezpieczne hasło powinno składać się z nieoczywistego połączenia słów, niepowiązanego z danymi osobowymi domowników. Musi być proste do zapamiętania i uzgodnione wyłącznie w formie ustnej.
W przypadku braku odpowiedzi na pytanie o hasło należy natychmiast rozłączyć się i samodzielnie zadzwonić do tej osoby na jej standardowy numer telefonu.
Nie, żadna instytucja państwowa, policja ani bank nigdy nie proszą przez telefon o przelewanie pieniędzy na awaryjne konta, przekazywanie gotówki kurierom ani podawanie kodów autoryzacyjnych BLIK.
Incydent należy zgłosić do zespołu CERT Polska wypełniając formularz na stronie incydent.cert.pl lub przesyłając treść podejrzanego SMS-a pod numer 8080.
Tak, zmiana statusu profilu na prywatny sprawia, że materiały wideo z nagranym głosem są dostępne tylko dla zweryfikowanych znajomych, co drastycznie ogranicza przestępcom dostęp do próbek audio.