Blog · 22 wpisów
Notatki z pracy z agentami AI na produkcji.
Prawdziwe problemy z moich produktów działających na produkcji: co się stało, jakie miałem opcje, co wybrałem i dlaczego. Tylko z własnej praktyki, bez ogólników o AI.
Zacznij od przeglądu mojej pracy z AI →AI engineer, ML engineer, product engineer, FDE: czego naprawdę wymagają ogłoszenia o pracę w AI w 2026
We wrześniu 2026 przeczytałem około 520 ogłoszeń o zdalnej pracy dla inżynierów, żeby sprawdzić, czy to, jak pracuję, pokrywa się z nazwami, których używa rynek. Observability wyprzedza każdy termin z AI, evals pojawiają się tylko w najlepiej płatnych rolach, a tytuły stanowisk układają się w cztery różne zawody.
agenci AI · AI engineering · rekrutacja9 min czytania
Claude Code hooks w praktyce: jak utrzymać sesję agenta przy jednym temacie
Launcher, który deklaruje cel każdej sesji, i hook na prompt, który blokuje prośby nie na temat, odkłada poboczne pomysły do jednolinijkowej skrzynki i eskaluje przy 250K-650K tokenów kontekstu, aż sesja zapisze handoff. Projekt, progi i błąd w parsowaniu flag.
Claude Code · agenci AI · context engineering10 min czytania
Spec-driven development z agentami kodującymi: specyfikacje, które agent skończy beze mnie
Budowa specyfikacji, którą agent kodujący skończy sam: model produktu, problem, cel, twarde ograniczenia, ponumerowane testy i blok zakończenia. Kto ją pisze, kto wykonuje, ile kosztuje przegląd i dlaczego specyfikacje zawodzą.
agenci AI · spec-driven development · Claude Code10 min czytania
Ten sam agent, odwrotne wyniki: o rezultacie decyduje kryterium wyjścia
Dwa zadania oddane temu samemu agentowi kodującemu: zadanie z jasnymi granicami przeszło 6/6 w 70 sekund, a otwarty brief badawczy wrócił jako notatka o postępach z jednym zmyślonym faktem. Dlaczego różnicę zrobiło kryterium wyjścia, a nie model.
agenci AI · Codex CLI · LLM evals9 min czytania
Context engineering dla agentów kodujących: dokumentacja projektu, z której agent wznawia pracę za 7K tokenów
Dokumentacja projektu to długoterminowa pamięć agenta kodującego. Zmierzyłem, ile kosztuje wznowienie wątku pracy: około 6,7K tokenów przy uporządkowanym drzewie dokumentacji wobec 39,5K przy czytaniu plików w całości. Progi, zasada podziału plików i ciche limity, które z tego wyszły.
context engineering · Claude Code · agenci AI9 min czytania
MCP w codziennej pracy inżyniera: lekkie sesje, ciężkie serwery na żądanie
Jakie serwery MCP zasługują na miejsce w codziennej pracy, dlaczego domyślnie ładują się tylko dwa, a ciężkie dochodzą per sesja, jakie kształty zapytań przyspieszają triage incydentów i jakie zasady trzymają agentów z dala od zapisów na produkcji.
MCP · Claude Code · agenci AI9 min czytania
Codex CLI obok Claude Code: jeden zbiór zasad, dwóch agentów
Jak używam Codex CLI od OpenAI obok Claude Code w tych samych repozytoriach: jeden zbiór zasad, jeden kontrakt hooka, zgodność MCP i skilli, launchery z profilami i reguła, który agent dostaje które zadanie.
Claude Code · Codex CLI · agenci AI10 min czytania
Jak nagłówek instrukcji dla LLM trafił do moich publicznych danych strukturalnych
Nagłówek z metadanymi napisany dla modelu ekstrakcji trafił do JSON-LD publicznych stron. Jak znalazłem go w źródle strony, jak naprawiłem to przy renderowaniu i w danych oraz jaka reguła governance z tego wynikła.
AI governance · LLM · dane strukturalne8 min czytania
Audyt zabezpieczeń mojego agenta kodującego: dziury, które znalazłem
Zrobiłem audyt zabezpieczeń wokół mojego agenta kodującego i znalazłem dziury: wywołanie API, które omijało ochronę przed usuwaniem, flagę regexa, która po cichu wyłączała hook, i allowlistę uprawnień, na której zebrały się dane uwierzytelniające.
Claude Code · agenci AI · bezpieczeństwo10 min czytania
Ile kosztowałby Claude Code na API: 30 dni transkryptów, policzone
Wyceniłem 30 dni transkryptów mojego agenta kodującego według publicznych stawek API: około 4176 USD, z czego ponad 90% to odczyty z cache, a 88% inputu poszło na tury z kontekstem powyżej 300K. Dlaczego przy długich sesjach wygrywa subskrypcja i jak to zmierzyć u siebie.
Claude Code · agenci AI · context engineering8 min czytania
Claude Code subagents i routing modeli: tanie zbieranie, mocna synteza
Szerokie zadanie badawcze na najmocniejszym modelu wyczerpało budżet, zanim powstała choćby jedna tabela. Drabina modeli, pilotaż przed rozdzieleniem pracy i minimalny kontekst dla subagentów, których dziś używam, żeby rozdzielać pracę między model mocny, średni i szybki.
agenci AI · Claude Code · context engineering10 min czytania
Każdy endpoint, który wywołuje model, to otwarty portfel
Każda ścieżka, która wywołuje płatny model, niesie ryzyko denial of wallet. Warstwy, które stosuję na każdym endpoincie z LLM: limity na użytkownika, dzienny limit wydatków, kill switch bez deployu, weryfikacja antybotowa, rejestr wydatków i osobne limity u dostawcy dla każdego środowiska.
AI · bezpieczeństwo · optymalizacja kosztów9 min czytania
Zielony build to nie dowód: jak sprawdzam zmiany wygenerowane przez AI
Automatyczny refaktor umieścił hook Reacta poza komponentem, przeszedł sprawdzanie typów i build, po czym położył panel administracyjny. Bramki, które dodałem, i to, jak robię code review zmian wygenerowanych przez AI oraz proponowanych przez nie paczek.
agenci AI · Claude Code · code review10 min czytania
Dlaczego przestałem ładować każdy skill do każdej sesji Claude Code
25 skilli, 5 agentów i 4 serwery MCP ładowane do każdej sesji, niezależnie od projektu. Pomogło nie dopisanie kolejnych docsów, tylko trzy warstwy i wiedza o tym, co naprawdę trafia do okna kontekstu i kiedy.
Claude Code · agenci AI · context engineering10 min czytania
Agent kodujący z dostępem do shella, a ja śpię spokojnie: zabezpieczenia (guardrails), których używam
Agent z dostępem do shella może skasować nie to, co trzeba, zrobić force-push albo ujawnić sekret i w każdym z tych przypadków zgłosić sukces. Cztery warstwy (tryb z kontrolą bezpieczeństwa, twarde reguły deny, hook przed wykonaniem i zachowanie) pozwalają mu skończyć pracę bez dotykania tego, czego nie da się cofnąć.
Claude Code · agenci AI · bezpieczeństwo11 min czytania
Dwóch agentów, dwa konteksty: Claude Code u siebie, Kiro CLI w korporacyjnym kodzie
Autonomiczny agent na własnym produkcie i zatwierdzony agent w dużym korporacyjnym kodzie to dwie różne dyscypliny. Co się przenosi, co się zmienia i dlaczego korporacyjne ograniczenia to zaleta, a nie wada.
Claude Code · Kiro CLI · agenci AI9 min czytania
Jak uruchamiać agentów kodujących równolegle na git worktrees
Jedna megasesja dryfuje. Alternatywa: podziel funkcję na trzy do pięciu podzadań o niskim ryzyku konfliktu, z kontraktami ustalonymi z góry, uruchom każde w osobnym git worktree z wyłączonym pushem i bez dostępu do bazy, a potem zintegruj wszystko raz, z testami end-to-end.
Claude Code · agenci AI · git10 min czytania
Model decyduje o czasie, spec o jakości: jak dobierać effort w Claude Code
Nieintuicyjna zasada po miesiącach codziennej pracy z agentami: przy dobrze wyspecyfikowanej pracy model to dźwignia czasu odpowiedzi, a nie jakości. Kiedy wydać pieniądze na wolne, drogie ustawienie, kiedy nie i dlaczego podkręcanie effortu nigdy nie naprawi mglistego planu.
Claude Code · agenci AI · workflow9 min czytania
Osiem miesięcy prowadzenia produktu w pojedynkę z agentami AI jako współinżynierami
Nie tygodniowy eksperyment, tylko codzienna praca: jak naprawdę organizuję pracę z Claude Code i Kiro CLI przy produkcyjnym projekcie pobocznym. Gdzie agenci realnie przyspieszają, gdzie nie, jakie zabezpieczenia pozwalają im działać samodzielnie i ile to kosztuje miesięcznie.
agenci AI · Claude Code · workflow11 min czytania
Evals przed merge: golden set za pipeline'em dopasowań AI
Jak testuję niedeterministyczny pipeline dopasowań AI przed merge: golden set zbudowany z prawdziwych decyzji w panelu admina, metryki rankingowe powiązane z tym, co widzi użytkownik, bramka zero naruszeń przed wdrożeniem i warianty, które nie pobiły punktu odniesienia.
LLM evals · AI · dopasowania11 min czytania
Tool use zamiast parsowania: ustrukturyzowane dane z LLM na produkcji
Jak wyciągać typowane pola z nieuporządkowanego tekstu za pomocą LLM: dlaczego JSON mode nie wystarcza, jak pomagają tool use i ścisłe schematy, czego schemat nadal nie gwarantuje i dlaczego dostawcę warto trzymać za adapterem.
AI · LLM · tool use9 min czytania
Podobieństwo cosinusowe to nie prawdopodobieństwo: strojenie progów w pgvector przy prawdziwych dopasowaniach
Mój retrieval zwracał 200 OK i zero wierszy, po cichu. Dlaczego surowe wyniki podobieństwa embeddingów zależą od modelu i same w sobie niewiele znaczą, jak wyglądają prawdziwe rozkłady wyników i jak skalibrowałem próg na parach testowych zamiast na intuicji.
pgvector · embeddings · RAG10 min czytania
Wpisy o Next.js, wydajności i bazach danych są na razie tylko po angielsku. Zobacz wszystkie wpisy (EN) →