Niezależny audyt kosztów LLM i GPU
Twoja firma przepłaca za AI. Sprawdzę o ile — i udowodnię, że da się taniej bez utraty jakości.
Audyt kosztów LLM i GPU w 3 tygodnie. Typowy wynik: 20–60% niższy rachunek, potwierdzony testami jakości na Waszych danych, nie obietnicą.
Bez zobowiązań. Jeśli audyt się u Was nie opłaci — powiem to wprost.
- Od dostępu do odczytu do raportu
- 3 tygodnie
- Typowa redukcja rachunku
- 20–60%
- Licencji dostawców, które sprzedaję
- 0
Gdzie uciekają pieniądze
Trzy sygnały, że przepłacacie
Każdy z nich widać w rachunku i w logach, zanim ktokolwiek dotknie linijki kodu.
25–50×
Rozpiętość cen między klasami modeli
Flagowy model do wszystkiego
Najdroższy model obsługuje też zadania trywialne — klasyfikację, wyciągnięcie jednego pola z dokumentu, przepisanie zdania — które tańszy wykonuje tak samo dobrze. Nikt tego nie wybrał świadomie; tak kończy się domyślne ustawienie z pierwszego prototypu, do którego nikt nie wrócił.
−90%
Tyle mniej kosztuje powtarzany kontekst z cache'em
Zero cache'owania
Wasze agenty wysyłają ten sam prompt systemowy, te same definicje narzędzi i te same dokumenty z wyszukiwania setki razy dziennie, za każdym razem w pełnej cenie. Prompt caching ścina ten koszt o około 90%. Jedno pole w logach mówi, czy za to płacicie.
2×
Dopłata za odpowiedź, na którą nikt nie czeka
Nocne zadania w dziennej taryfie
Indeksowanie, wzbogacanie danych, przeliczanie ocen, nocne raporty — praca, po drugiej stronie której nie siedzi użytkownik — idzie przez API synchroniczne i kosztuje mniej więcej dwa razy tyle, co ścieżka wsadowa. Kolejka liczy się w godzinach, a termin to jutro rano.
Rząd wielkości
Ile to może być u Was
Do pierwszego szacunku wystarczą dwie liczby, które już znacie. Audyt zamienia szacunek na wartość zmierzoną na Waszym ruchu.
Faktury za API modeli, inferencja na GPU i jej hosting.
Szacowane oszczędności miesięcznie
12 000 zł – 32 400 zł
W skali roku
144 000 zł – 388 800 zł
To 20–54% dzisiejszego rachunku.
Przy wydatkach 60 000 zł miesięcznie i udziale agentów 40% szacowane oszczędności wynoszą od 12 000 zł do 32 400 zł miesięcznie, czyli od 144 000 zł do 388 800 zł rocznie.
Szacunek. Audyt zastępuje go liczbą zmierzoną.
Dolna granica to scenariusz ostrożny: sam routing i tryb wsadowy. Górna rośnie z udziałem agentów, bo to powtarzany kontekst zwraca się na cache'u najszybciej.
Metoda
Jak pracuję
Cztery kroki, trzy tygodnie, jedna zasada: do raportu nie trafia nic, czego nie zmierzyłem.
Dostęp tylko do odczytu
Billing, logi inferencji, metryki GPU. Bez zmian w kodzie, bez dostępu do produkcji, bez prawa do wdrożeń. Jeśli wymaga tego Wasza polityka, wystarczy wyeksportowany zbiór.
Zamrożona baza odniesienia
Koszt jednostkowy każdej funkcji — za zapytanie, za dokument, za użytkownika — plus test jakości na Waszych danych, z metrykami uzgodnionymi na starcie. To punkt, do którego wraca każde późniejsze twierdzenie.
Testowanie hipotez
Tu tańszy model, tam cache, gdzie indziej tryb wsadowy albo inny rozmiar instancji. Każdą hipotezę mierzę względem bazy na dwóch osiach: koszt i jakość. Jeśli jakość spada, hipoteza nie trafia do raportu.
Raport
Oszczędności w pieniądzu miesięcznie, nie w procentach. Plan wdrożenia, ryzyka i to, czego bym nie ruszał. Każda liczba odtwarzalna z Waszych danych.
Wynik
Co dostajecie
Dokumenty, na których pracuje Wasz zespół inżynierski i które sprawdzi Wasz dział finansowy.
Mapa kosztów z priorytetami
Rachunek rozbity na funkcje, modele i zespoły, z podziałem na szybkie wygrane i zmiany wymagające realnej pracy inżynierskiej — z oszacowanym nakładem dla każdej.
Wyniki testów jakości
Porównanie przed i po dla każdej rekomendacji, na Waszym zbiorze i według metryk uzgodnionych, zanim padła pierwsza propozycja zmiany.
Plan wdrożenia dla Waszego zespołu
Kolejność zmian, szacowany czas, punkty wycofania. Napisany tak, żeby wykonali go Wasi inżynierowie — wiedza zostaje u Was, kiedy ja kończę.
Potencjał oszczędności miesięcznie
Jedna liczba na wierzchu i pełna arytmetyka pod spodem, łącznie z tym, czego odradzam ruszać, i dlaczego.
Zastrzeżenia
Cztery pytania, które słyszę zawsze
O mnie
Z kim pracujecie
Buduję aplikacje AI i specjalizuję się wyłącznie w ekonomii inferencji — tokeny, cache, routing modeli, pomiar energii GPU. Nie sprzedaję wdrożeń ani licencji żadnego dostawcy; klauzula niezależności jest w każdej umowie.
Centrom danych i firmom z własnym sprzętem przygotowuję też raportowanie energii zgodne z dyrektywą EED: PUE, WUE, ERF i REF — zmierzone, nie oszacowane.
Umów 30-minutową rozmowęYour Name
- hello@example.com
- linkedin.com/in/your-profile