Jak analizować logi serwerowe
Analizator czyta logi lokalnie w przeglądarce i tworzy z nich zagregowany raport technicznego SEO. Surowy plik nie jest wysyłany na serwer. Do bazy trafia tylko projekt zawierający agregaty, a do AI — podsumowania i kilka przykładów diagnostycznych.
Obsługiwane formaty
| Format | Wskazówka |
|---|---|
| Apache Common / Combined | Standardowe access logi, również domyślny format wielu konfiguracji Nginx. |
| IIS / CloudFront W3C | Parser korzysta z wiersza #Fields:, dlatego kolejność kolumn może się zmieniać. |
| AWS ALB | Obsługiwany jest standardowy log Application Load Balancera z polami w cudzysłowach. |
| JSON Lines | Jedno zdarzenie JSON na wiersz; pola można wskazać ręcznie ścieżką, np. httpRequest.status. |
| Format niestandardowy | Użyj nazwanego regexu albo kolumn rozdzielanych separatorem. |
Limit szczegółów URL
Domyślny i zalecany limit wynosi 200 000 unikalnych URL-i. Przed analizą możesz wybrać również 300 000 lub 500 000. Wyższy limit zwiększa zużycie pamięci; wariant 500 000 może zużyć ponad 1 GB RAM i spowolnić albo zatrzymać kartę przeglądarki, szczególnie podczas budowania raportu i eksportu XLSX.
Po osiągnięciu wybranego limitu aplikacja nadal liczy wszystkie żądania, statusy, boty, integracje, transfer i dane dzienne. Nowe adresy ponad limit nie trafiają jednak do tabel i analiz zależnych od pełnej listy URL-i. Raport pokazuje faktycznie użyty limit oraz liczbę żądań pominiętych wyłącznie na poziomie szczegółów URL.
Pełne i klikalne URL-e
Jeśli log zapisuje tylko ścieżki, podaj domenę analizowanego serwisu. Aplikacja próbuje również wykryć ją z nazwy pliku, np. example.com.access.log. W tabelach pozostaje krótka ścieżka, ale jest ona klikalna, a eksporty CSV i XLSX otrzymują pełny adres z domeną.
Weryfikacja Googlebota
Po włączeniu weryfikacji aplikacja pobiera oficjalne zakresy Google i sprawdza adresy IP lokalnie w parserze. Adresy IP nie są zapisywane w raporcie ani wysyłane do bazy. Jeśli zakresów nie uda się pobrać, raport wyraźnie oznaczy rozpoznanie tylko po user-agencie.
Wszystkie roboty
Przegląd obejmuje wyszukiwarki, boty AI, narzędzia SEO, roboty social media, proxy podglądów oraz automaty przeglądarkowe. Osobno rozpoznawane są m.in. OAI-SearchBot, OAI-AdsBot, ChatGPT-User, GPTBot, ClaudeBot, Claude-SearchBot, Claude-User, PerplexityBot, Perplexity-User i Google Cloud Vertex AI. Lista zawiera też crawlery Meta (External Agent, External Ads i Web Indexer), popularne boty Ahrefs, Semrush, Majestic, DataForSEO, Serpstat, BLEX, MegaIndex, Screaming Frog, Sitebulb, SISTRIX i Diffbot, a także WP Image Proxy, Yahoo Mail Proxy i Headless Browser. Dla każdej rodziny raport pokazuje żądania, URL-e, kody HTTP, transfer, błędy, percentyle i łączny czas serwera.
Integracje/API
Biblioteki Apache HttpClient i Symfony HttpClient są klasyfikowane jako automatyczny ruch serwer–serwer. Nie zwiększają liczby użytkowników ani robotów indeksujących. Raport pokazuje ich rodziny, URL-e, kody odpowiedzi, błędy, transfer i czas serwera w osobnej sekcji.
Porównanie okresów
Włącz przełącznik Porównanie okresów i dodaj wcześniejsze logi jako zestaw bazowy. Bieżące logi są analizowane jako pierwsze. Na dole raportu powstaje oddzielna sekcja ze zmianą kluczowych metryk, kodów HTTP i aktywności rodzin robotów. Przy różnej długości okresów porównuj także udziały oraz tempo dzienne, a nie tylko wolumen.
Sitemapy i analizy rozszerzone
Po zaznaczeniu Połącz sitemapę podaj domenę albo bezpośredni adres XML. Analizator odczyta deklaracje z robots.txt, indeksy, zagnieżdżone pliki i GZIP. Następnie sprawdzi każdy URL po HTTP w małych paczkach: kod odpowiedzi, przekierowania, adres końcowy, Content-Type, czas, rozmiar, meta robots, X-Robots-Tag, canonical, tytuł i język. Wyniki są oznaczane jako pochodzące z sitemapy, aktywnej kontroli HTTP albo logów; wiersze łączące źródła mają wszystkie oznaczenia. Rozszerzona sekcja pokazuje również częstotliwość ponownych wizyt URL-i, P50/P75/P95/P99 czasu odpowiedzi, zdrowie żądań /robots.txt, parametry tworzące warianty adresów oraz koszt rodzin robotów.
Łączenie logów z Senuto i GSC
W sekcji Połącz dane SEO możesz niezależnie włączyć eksport widoczności oraz Google Search Console. Eksport Senuto może być plikiem CSV, TSV, TXT, XLSX, XLS lub XLSB. Wymagane są kolumny URL i Słowo kluczowe; opcjonalne pola to Wolumen, Pozycja i Szacowany ruch. Aplikacja rozpoznaje nagłówki, ale mapowanie zawsze można sprawdzić i poprawić przed uruchomieniem raportu.
GSC korzysta z konta Google połączonego już w SEO Nest. Wybierz konto i usługę. Puste daty oznaczają zakres od pierwszego do ostatniego zdarzenia w analizowanych logach; możesz też ustawić inny okres ręcznie. Limit 10 000–100 000 dotyczy szczegółowych wierszy zapytań. Osiągnięcie limitu jest widoczne w raporcie i należy je uwzględnić przy interpretacji.
Adresy są najpierw łączone dokładnie. Dopasowanie uproszczone usuwa tylko znane parametry kampanii lub sesji i jest akceptowane wyłącznie wtedy, gdy istnieje jeden kandydat. Warianty niejednoznaczne są oznaczane, a nie łączone automatycznie. Priorytety P1–P3 wynikają ze statusów HTTP i kwartylów bieżącego zbioru — nie są ukrytym wynikiem punktowym.
Nowa sekcja raportu ma własne zakładki typów diagnoz z licznikami, filtry, sortowanie, stronicowanie po 25 URL-i, eksport pełnego przefiltrowanego CSV, wieloarkuszowy Excel oraz wykresy do pobrania. Szczegółowe frazy Senuto i zapytania GSC są doładowywane dopiero po rozwinięciu URL-a. Projekt zapisuje komplet agregatów, do 75 000 połączonych URL-i oraz do 30 000 szczegółów każdego źródła. Surowy plik Senuto, token Google i surowe logi nie są zapisywane.
Eksport wykresów
Każda karta wykresu ma akcje CSV, PNG i PEŁNY XLSX. CSV zawiera dane aktywnego widoku wykresu, PNG tworzy samowystarczalną grafikę bez ładowania zewnętrznych zasobów, a pełny Excel zapisuje wszystkie tabele i dane wykresów w osobnych, opisanych arkuszach.
Wydajność i limity
Pliki są czytane strumieniowo w osobnym wątku. Tabele powstają dopiero po otwarciu zakładki i pokazują po 25 rekordów. Dla ochrony pamięci jedna analiza przechowuje maksymalnie 200 000 unikalnych URL-i. Kontrola sitemapy działa w paczkach po 12 adresów, a postęp i szacowany czas są pokazywane na bieżąco. Projekt w bazie zachowuje pełne agregaty oraz do 30 000 szczegółowych wyników technicznego audytu sitemapy, aby zapis nie przekraczał bezpiecznego limitu.
Jak czytać priorytety
- P1: częste błędy 5xx, błędy Googlebota na ważnych stronach, niestabilne odpowiedzi i awarie obejmujące duży udział ruchu.
- P2: masowe 404, adresy noindex lub z niezgodnym canonicalem w sitemapie, zasoby techniczne dominujące w crawlowaniu i słabe odkrywanie ważnych sekcji.
- P3: optymalizacja cache, dużych obrazów, porządkowanie pojedynczych odsyłaczy i dalsze strojenie częstotliwości crawlowania.