Audyt kosztów AI

Niezależny audyt kosztów LLM i GPU

Twoja firma przepłaca za AI. Sprawdzę o ile — i udowodnię, że da się taniej bez utraty jakości.

Audyt kosztów LLM i GPU w 3 tygodnie. Typowy wynik: 20–60% niższy rachunek, potwierdzony testami jakości na Waszych danych, nie obietnicą.

Umów 30-minutową rozmowę

Bez zobowiązań. Jeśli audyt się u Was nie opłaci — powiem to wprost.

Od dostępu do odczytu do raportu
3 tygodnie
Typowa redukcja rachunku
20–60%
Licencji dostawców, które sprzedaję
0

Gdzie uciekają pieniądze

Trzy sygnały, że przepłacacie

Każdy z nich widać w rachunku i w logach, zanim ktokolwiek dotknie linijki kodu.

  • 25–50×

    Rozpiętość cen między klasami modeli

    Flagowy model do wszystkiego

    Najdroższy model obsługuje też zadania trywialne — klasyfikację, wyciągnięcie jednego pola z dokumentu, przepisanie zdania — które tańszy wykonuje tak samo dobrze. Nikt tego nie wybrał świadomie; tak kończy się domyślne ustawienie z pierwszego prototypu, do którego nikt nie wrócił.

  • −90%

    Tyle mniej kosztuje powtarzany kontekst z cache'em

    Zero cache'owania

    Wasze agenty wysyłają ten sam prompt systemowy, te same definicje narzędzi i te same dokumenty z wyszukiwania setki razy dziennie, za każdym razem w pełnej cenie. Prompt caching ścina ten koszt o około 90%. Jedno pole w logach mówi, czy za to płacicie.

  • Dopłata za odpowiedź, na którą nikt nie czeka

    Nocne zadania w dziennej taryfie

    Indeksowanie, wzbogacanie danych, przeliczanie ocen, nocne raporty — praca, po drugiej stronie której nie siedzi użytkownik — idzie przez API synchroniczne i kosztuje mniej więcej dwa razy tyle, co ścieżka wsadowa. Kolejka liczy się w godzinach, a termin to jutro rano.

Rząd wielkości

Ile to może być u Was

Do pierwszego szacunku wystarczą dwie liczby, które już znacie. Audyt zamienia szacunek na wartość zmierzoną na Waszym ruchu.

Faktury za API modeli, inferencja na GPU i jej hosting.

Im więcej powtarzanego kontekstu wysyłacie, tym więcej wraca dzięki cache'owi.

Szacowane oszczędności miesięcznie

12 000 zł32 400 zł

W skali roku

144 000 zł388 800 zł

To 20–54% dzisiejszego rachunku.

Przy wydatkach 60 000 zł miesięcznie i udziale agentów 40% szacowane oszczędności wynoszą od 12 000 zł do 32 400 zł miesięcznie, czyli od 144 000 zł do 388 800 zł rocznie.

Szacunek. Audyt zastępuje go liczbą zmierzoną.

Dolna granica to scenariusz ostrożny: sam routing i tryb wsadowy. Górna rośnie z udziałem agentów, bo to powtarzany kontekst zwraca się na cache'u najszybciej.

Umów 30-minutową rozmowę

Metoda

Jak pracuję

Cztery kroki, trzy tygodnie, jedna zasada: do raportu nie trafia nic, czego nie zmierzyłem.

  1. Dostęp tylko do odczytu

    Billing, logi inferencji, metryki GPU. Bez zmian w kodzie, bez dostępu do produkcji, bez prawa do wdrożeń. Jeśli wymaga tego Wasza polityka, wystarczy wyeksportowany zbiór.

  2. Zamrożona baza odniesienia

    Koszt jednostkowy każdej funkcji — za zapytanie, za dokument, za użytkownika — plus test jakości na Waszych danych, z metrykami uzgodnionymi na starcie. To punkt, do którego wraca każde późniejsze twierdzenie.

  3. Testowanie hipotez

    Tu tańszy model, tam cache, gdzie indziej tryb wsadowy albo inny rozmiar instancji. Każdą hipotezę mierzę względem bazy na dwóch osiach: koszt i jakość. Jeśli jakość spada, hipoteza nie trafia do raportu.

  4. Raport

    Oszczędności w pieniądzu miesięcznie, nie w procentach. Plan wdrożenia, ryzyka i to, czego bym nie ruszał. Każda liczba odtwarzalna z Waszych danych.

Wynik

Co dostajecie

Dokumenty, na których pracuje Wasz zespół inżynierski i które sprawdzi Wasz dział finansowy.

  • Mapa kosztów z priorytetami

    Rachunek rozbity na funkcje, modele i zespoły, z podziałem na szybkie wygrane i zmiany wymagające realnej pracy inżynierskiej — z oszacowanym nakładem dla każdej.

  • Wyniki testów jakości

    Porównanie przed i po dla każdej rekomendacji, na Waszym zbiorze i według metryk uzgodnionych, zanim padła pierwsza propozycja zmiany.

  • Plan wdrożenia dla Waszego zespołu

    Kolejność zmian, szacowany czas, punkty wycofania. Napisany tak, żeby wykonali go Wasi inżynierowie — wiedza zostaje u Was, kiedy ja kończę.

  • Potencjał oszczędności miesięcznie

    Jedna liczba na wierzchu i pełna arytmetyka pod spodem, łącznie z tym, czego odradzam ruszać, i dlaczego.

Zastrzeżenia

Cztery pytania, które słyszę zawsze

O mnie

Z kim pracujecie

Buduję aplikacje AI i specjalizuję się wyłącznie w ekonomii inferencji — tokeny, cache, routing modeli, pomiar energii GPU. Nie sprzedaję wdrożeń ani licencji żadnego dostawcy; klauzula niezależności jest w każdej umowie.

Centrom danych i firmom z własnym sprzętem przygotowuję też raportowanie energii zgodne z dyrektywą EED: PUE, WUE, ERF i REF — zmierzone, nie oszacowane.

Umów 30-minutową rozmowę