Dostępny na nowe rolePiotr Czerwiński

Blog · 22 wpisów

Notatki z pracy z agentami AI na produkcji.

Prawdziwe problemy z moich produktów działających na produkcji: co się stało, jakie miałem opcje, co wybrałem i dlaczego. Tylko z własnej praktyki, bez ogólników o AI.

Zacznij od przeglądu mojej pracy z AI →
  1. AI engineer, ML engineer, product engineer, FDE: czego naprawdę wymagają ogłoszenia o pracę w AI w 2026

    We wrześniu 2026 przeczytałem około 520 ogłoszeń o zdalnej pracy dla inżynierów, żeby sprawdzić, czy to, jak pracuję, pokrywa się z nazwami, których używa rynek. Observability wyprzedza każdy termin z AI, evals pojawiają się tylko w najlepiej płatnych rolach, a tytuły stanowisk układają się w cztery różne zawody.

    agenci AI · AI engineering · rekrutacja9 min czytania

  2. Claude Code hooks w praktyce: jak utrzymać sesję agenta przy jednym temacie

    Launcher, który deklaruje cel każdej sesji, i hook na prompt, który blokuje prośby nie na temat, odkłada poboczne pomysły do jednolinijkowej skrzynki i eskaluje przy 250K-650K tokenów kontekstu, aż sesja zapisze handoff. Projekt, progi i błąd w parsowaniu flag.

    Claude Code · agenci AI · context engineering10 min czytania

  3. Spec-driven development z agentami kodującymi: specyfikacje, które agent skończy beze mnie

    Budowa specyfikacji, którą agent kodujący skończy sam: model produktu, problem, cel, twarde ograniczenia, ponumerowane testy i blok zakończenia. Kto ją pisze, kto wykonuje, ile kosztuje przegląd i dlaczego specyfikacje zawodzą.

    agenci AI · spec-driven development · Claude Code10 min czytania

  4. Ten sam agent, odwrotne wyniki: o rezultacie decyduje kryterium wyjścia

    Dwa zadania oddane temu samemu agentowi kodującemu: zadanie z jasnymi granicami przeszło 6/6 w 70 sekund, a otwarty brief badawczy wrócił jako notatka o postępach z jednym zmyślonym faktem. Dlaczego różnicę zrobiło kryterium wyjścia, a nie model.

    agenci AI · Codex CLI · LLM evals9 min czytania

  5. Context engineering dla agentów kodujących: dokumentacja projektu, z której agent wznawia pracę za 7K tokenów

    Dokumentacja projektu to długoterminowa pamięć agenta kodującego. Zmierzyłem, ile kosztuje wznowienie wątku pracy: około 6,7K tokenów przy uporządkowanym drzewie dokumentacji wobec 39,5K przy czytaniu plików w całości. Progi, zasada podziału plików i ciche limity, które z tego wyszły.

    context engineering · Claude Code · agenci AI9 min czytania

  6. MCP w codziennej pracy inżyniera: lekkie sesje, ciężkie serwery na żądanie

    Jakie serwery MCP zasługują na miejsce w codziennej pracy, dlaczego domyślnie ładują się tylko dwa, a ciężkie dochodzą per sesja, jakie kształty zapytań przyspieszają triage incydentów i jakie zasady trzymają agentów z dala od zapisów na produkcji.

    MCP · Claude Code · agenci AI9 min czytania

  7. Codex CLI obok Claude Code: jeden zbiór zasad, dwóch agentów

    Jak używam Codex CLI od OpenAI obok Claude Code w tych samych repozytoriach: jeden zbiór zasad, jeden kontrakt hooka, zgodność MCP i skilli, launchery z profilami i reguła, który agent dostaje które zadanie.

    Claude Code · Codex CLI · agenci AI10 min czytania

  8. Jak nagłówek instrukcji dla LLM trafił do moich publicznych danych strukturalnych

    Nagłówek z metadanymi napisany dla modelu ekstrakcji trafił do JSON-LD publicznych stron. Jak znalazłem go w źródle strony, jak naprawiłem to przy renderowaniu i w danych oraz jaka reguła governance z tego wynikła.

    AI governance · LLM · dane strukturalne8 min czytania

  9. Audyt zabezpieczeń mojego agenta kodującego: dziury, które znalazłem

    Zrobiłem audyt zabezpieczeń wokół mojego agenta kodującego i znalazłem dziury: wywołanie API, które omijało ochronę przed usuwaniem, flagę regexa, która po cichu wyłączała hook, i allowlistę uprawnień, na której zebrały się dane uwierzytelniające.

    Claude Code · agenci AI · bezpieczeństwo10 min czytania

  10. Ile kosztowałby Claude Code na API: 30 dni transkryptów, policzone

    Wyceniłem 30 dni transkryptów mojego agenta kodującego według publicznych stawek API: około 4176 USD, z czego ponad 90% to odczyty z cache, a 88% inputu poszło na tury z kontekstem powyżej 300K. Dlaczego przy długich sesjach wygrywa subskrypcja i jak to zmierzyć u siebie.

    Claude Code · agenci AI · context engineering8 min czytania

  11. Claude Code subagents i routing modeli: tanie zbieranie, mocna synteza

    Szerokie zadanie badawcze na najmocniejszym modelu wyczerpało budżet, zanim powstała choćby jedna tabela. Drabina modeli, pilotaż przed rozdzieleniem pracy i minimalny kontekst dla subagentów, których dziś używam, żeby rozdzielać pracę między model mocny, średni i szybki.

    agenci AI · Claude Code · context engineering10 min czytania

  12. Każdy endpoint, który wywołuje model, to otwarty portfel

    Każda ścieżka, która wywołuje płatny model, niesie ryzyko denial of wallet. Warstwy, które stosuję na każdym endpoincie z LLM: limity na użytkownika, dzienny limit wydatków, kill switch bez deployu, weryfikacja antybotowa, rejestr wydatków i osobne limity u dostawcy dla każdego środowiska.

    AI · bezpieczeństwo · optymalizacja kosztów9 min czytania

  13. Zielony build to nie dowód: jak sprawdzam zmiany wygenerowane przez AI

    Automatyczny refaktor umieścił hook Reacta poza komponentem, przeszedł sprawdzanie typów i build, po czym położył panel administracyjny. Bramki, które dodałem, i to, jak robię code review zmian wygenerowanych przez AI oraz proponowanych przez nie paczek.

    agenci AI · Claude Code · code review10 min czytania

  14. Dlaczego przestałem ładować każdy skill do każdej sesji Claude Code

    25 skilli, 5 agentów i 4 serwery MCP ładowane do każdej sesji, niezależnie od projektu. Pomogło nie dopisanie kolejnych docsów, tylko trzy warstwy i wiedza o tym, co naprawdę trafia do okna kontekstu i kiedy.

    Claude Code · agenci AI · context engineering10 min czytania

  15. Agent kodujący z dostępem do shella, a ja śpię spokojnie: zabezpieczenia (guardrails), których używam

    Agent z dostępem do shella może skasować nie to, co trzeba, zrobić force-push albo ujawnić sekret i w każdym z tych przypadków zgłosić sukces. Cztery warstwy (tryb z kontrolą bezpieczeństwa, twarde reguły deny, hook przed wykonaniem i zachowanie) pozwalają mu skończyć pracę bez dotykania tego, czego nie da się cofnąć.

    Claude Code · agenci AI · bezpieczeństwo11 min czytania

  16. Dwóch agentów, dwa konteksty: Claude Code u siebie, Kiro CLI w korporacyjnym kodzie

    Autonomiczny agent na własnym produkcie i zatwierdzony agent w dużym korporacyjnym kodzie to dwie różne dyscypliny. Co się przenosi, co się zmienia i dlaczego korporacyjne ograniczenia to zaleta, a nie wada.

    Claude Code · Kiro CLI · agenci AI9 min czytania

  17. Jak uruchamiać agentów kodujących równolegle na git worktrees

    Jedna megasesja dryfuje. Alternatywa: podziel funkcję na trzy do pięciu podzadań o niskim ryzyku konfliktu, z kontraktami ustalonymi z góry, uruchom każde w osobnym git worktree z wyłączonym pushem i bez dostępu do bazy, a potem zintegruj wszystko raz, z testami end-to-end.

    Claude Code · agenci AI · git10 min czytania

  18. Model decyduje o czasie, spec o jakości: jak dobierać effort w Claude Code

    Nieintuicyjna zasada po miesiącach codziennej pracy z agentami: przy dobrze wyspecyfikowanej pracy model to dźwignia czasu odpowiedzi, a nie jakości. Kiedy wydać pieniądze na wolne, drogie ustawienie, kiedy nie i dlaczego podkręcanie effortu nigdy nie naprawi mglistego planu.

    Claude Code · agenci AI · workflow9 min czytania

  19. Osiem miesięcy prowadzenia produktu w pojedynkę z agentami AI jako współinżynierami

    Nie tygodniowy eksperyment, tylko codzienna praca: jak naprawdę organizuję pracę z Claude Code i Kiro CLI przy produkcyjnym projekcie pobocznym. Gdzie agenci realnie przyspieszają, gdzie nie, jakie zabezpieczenia pozwalają im działać samodzielnie i ile to kosztuje miesięcznie.

    agenci AI · Claude Code · workflow11 min czytania

  20. Evals przed merge: golden set za pipeline'em dopasowań AI

    Jak testuję niedeterministyczny pipeline dopasowań AI przed merge: golden set zbudowany z prawdziwych decyzji w panelu admina, metryki rankingowe powiązane z tym, co widzi użytkownik, bramka zero naruszeń przed wdrożeniem i warianty, które nie pobiły punktu odniesienia.

    LLM evals · AI · dopasowania11 min czytania

  21. Tool use zamiast parsowania: ustrukturyzowane dane z LLM na produkcji

    Jak wyciągać typowane pola z nieuporządkowanego tekstu za pomocą LLM: dlaczego JSON mode nie wystarcza, jak pomagają tool use i ścisłe schematy, czego schemat nadal nie gwarantuje i dlaczego dostawcę warto trzymać za adapterem.

    AI · LLM · tool use9 min czytania

  22. Podobieństwo cosinusowe to nie prawdopodobieństwo: strojenie progów w pgvector przy prawdziwych dopasowaniach

    Mój retrieval zwracał 200 OK i zero wierszy, po cichu. Dlaczego surowe wyniki podobieństwa embeddingów zależą od modelu i same w sobie niewiele znaczą, jak wyglądają prawdziwe rozkłady wyników i jak skalibrowałem próg na parach testowych zamiast na intuicji.

    pgvector · embeddings · RAG10 min czytania

Wpisy o Next.js, wydajności i bazach danych są na razie tylko po angielsku. Zobacz wszystkie wpisy (EN) →