Dokumentacja

    Raport: "Human-generated text" 2026. Jak bardzo ludzkie są teksty generowane przez AI?

    Badanie: zespół Funelo (Mateusz Siwek)Ostatnia aktualizacja:

    W skrócie

    W badaniu 300 tekstów copywriterskich zweryfikowanych detektorem GPTZero Funelo uzyskało średnio 43,5/100 punktów „human-score", wyprzedzając Claude (34,5), ChatGPT (21,8) i Gemini (16,5). Oznacza to ok. 2x wyższy wynik omijania detekcji AI niż ChatGPT w najbardziej wymagających formatach reklamowych.

    W dobie powszechnej automatyzacji treści, kluczowym wyzwaniem dla marketerów i twórców staje się unikalność oraz "ludzki pierwiastek" tekstu.

    Przeprowadziliśmy rygorystyczne badanie, analizując 300 tekstów wygenerowanych przez najpopularniejsze modele językowe oraz Funelo, aby sprawdzić, które z nich najlepiej radzą sobie z ominięciem detektorów AI.

    Metodologia badania

    • Narzędzie weryfikujące: GPTZero – uznawany za nr 1 na świecie, 99% skuteczności.
    • Próba badawcza: 300 tekstów rozdzielonych na 3 główne nisze rynkowe w branży infobiznesu: Inwestycje/Pieniądze, Relacje i Zdrowie/Lifestyle.
    • Specyfika detekcji: Choć średnie wyniki są zróżnicowane, detekcja w pojedynczych próbach często przyjmowała formę binarną (0% lub 100% human score), co podkreśla wagę powtarzalności wyników.

    Metodologia punktacji i interpretacja wyników

    GPTZero klasyfikuje treść w trzech kategoriach: Human, AI oraz Mixed. Aby uzyskać obiektywny miernik "ludzkości" tekstu, zastosowaliśmy następujący system punktowy w skali 0–100:

    • Human-Generated Score: Punkty przyznawane bezpośrednio na podstawie procentowej pewności narzędzia co do ludzkiego pochodzenia tekstu (np. wynik 58% Human = 58 pkt).
    • Teksty mieszane (Mixed): W przypadku tekstów zaklasyfikowanych jako „mieszane", stosowaliśmy współczynnik korygujący 0.5. Wynik ten odzwierciedla niepewność algorytmu i sugeruje częściową ingerencję AI (np. 40% Mixed = 20 pkt).
    • AI-Generated: Wynik 0% w kategorii Human (pełna detekcja AI) oznaczał przyznanie 0 pkt w naszym rankingu.

    Wyniki Ogólne: Ranking Modeli (Średnia)

    Poniższe zestawienie przedstawia średni wynik "ludzkości" tekstów dla wszystkich kategorii zadań.

    Średnia wyników Human-generated tekst

    Analiza Szczegółowa: Gdzie AI radzi sobie najlepiej?

    Analiza poszczególnych formatów reklamowych i copywriterskich wykazuje ogromne rozbieżności w jakości generowanego tekstu.

    ZadanieFuneloChatGPTGeminiClaude
    Średnia wyników43,521,816,534,5
    Nagłówki92,357,083,371,7
    Ulepszony copywriting33,733,024,00,3
    Bullet points45,034,018,731,3
    Hook35,00,07,00,0
    Gwarancja34,016,713,074,3
    CTA51,00,021,710,0
    Body reklamy34,00,00,046,7
    Email marketingowy33,733,30,07,7
    Reklama PAS41,033,322,317,3
    Reklama z mini-historią23,00,312,053,3
    Shumanizowany tekst66,720,713,32,3
    Post na LinkedIn42,30,00,033,3
    Reklama Social Proof33,343,00,066,7
    Reklama z luką ciekawości44,333,315,067,7

    1. Największe zaskoczenia (Liderzy kategorii)

    • Nagłówki: To najsilniejsza strona wszystkich modeli. Funelo osiąga tu niemal perfekcyjny wynik 92,3/100, wyprzedzając Gemini (83,3) i ChatGPT (57,0).
    • Tekst Shumanizowany: W zadaniu polegającym na celowym nadaniu tekstowi ludzkiego charakteru, Funelo zdeklasowało konkurencję z wynikiem 66,7, podczas gdy reszta modeli spadła poniżej 21 punktów.
    • Gwarancje i Social Proof: Claude okazuje się liderem w pisaniu gwarancji (74,3) oraz treści opartych na dowodach społecznych (66,7).

    2. Słabe punkty (Łatwa detekcja AI)

    • Hooki i CTA: ChatGPT i Claude w wielu próbach uzyskały wynik 0,0, co oznacza, że ich wezwania do działania i "haczyki" są dla detektorów całkowicie przewidywalne i maszynowe.
    • E-mail marketing: Gemini kompletnie nie radzi sobie z zachowaniem ludzkiego tonu w e-mailach (0,0), podczas gdy Funelo i ChatGPT trzymają solidny poziom ok. 33,0.

    Kluczowe Wnioski dla Biznesu

    Wniosek #1: Standardowe modele (ChatGPT, Gemini) mają tendencję do generowania bardzo "wyglansowanych" i przewidywalnych struktur, co sprawia, że są łatwo wykrywalne przez algorytmy wyszukiwania czy social media.

    Wniosek #2: Specjalizacja ma znaczenie. Agent Funelo uzyskuje średnio 2x lepsze wyniki w omijaniu detekcji niż ChatGPT.

    Wniosek #3: Teksty "humanizowane" i kreatywne formaty (np. mini-historia) są najtrudniejsze do podrobienia. W kategorii mini-historii Claude (53,3) wygrywa z ChatGPT (0,3), co sugeruje, że Claude lepiej radzi sobie z narracją emocjonalną, natomiast Funelo zajmuje tutaj drugie miejsce.

    Podsumowanie

    Dla przedsiębiorców sprzedających swoje doświadczenie przez kursy, szkolenia i usługi, gdzie autentyczność buduje zaufanie i wpływa na sprzedaż, wybór odpowiedniego narzędzia jest kluczowy. Badanie pokazuje, że surowe teksty z popularnych modeli AI wymagają głębokiej edycji lub zastosowania narzędzi wyspecjalizowanych w pisaniu tekstów z ludzkim pierwiastkiem, takich jak Funelo.