Jak ostatnio pisałem o sędzim, który ocenia mój benchmark, zostawiłem jedną rzecz na boku. Bo tam opowiadałem o dokładaniu modelu do oceniania, a nie o tym, że model jest w tej cał…
Kiedy ostatnio pisałem o benchmarku (kod, który zabija przeglądarkę), przemilczałem nudną część. Szesnaście modeli, po sześć prób, jedno zadanie – to jest 96 plików HTML, któ…
Po ostatnich ruchach Anthropica – wyższe ceny, mocno ścięte limity – wraca pytanie, które słyszę coraz częściej: „Codex czy Claude Code?”. I moim zdaniem je…
Ostatnio grzebałem przy pluginie Refio i testowałem go na lokalnych modelach LLM. Teoretycznie wszystko działało: model miał dostać cały kontekst projektu – otwarte pliki z I…
Jest taki moment, kiedy model zwraca kod, plik się otwiera i przez dwie sekundy myślisz, że działa. Czasem faktycznie. A czasem karta przeglądarki zostaje pusta, albo wyskakuje bia…
Robię benchmark lokalnych modeli. Proste zadanie: zbuduj Todo App w jednym pliku HTML – dodawanie, kasowanie, oznaczanie, filtry, localStorage. Banał. Każdy model dostaje 6 p…
Prawdziwie praktyczny RAG? To nie jest tylko zbudowanie wektorowego indeksu i nadzieja, że LLM znajdzie wszystko sam. Gdy pracujesz nad projektem, liczysz na asystenta, który napra…
Claude Code to narzędzie terminalowe stworzone przez Anthropic, które pozwala programistom pracować z kodem przy pomocy języka naturalnego. Nie jest to zwykły czat, ale coś w rodza…
Od kilku miesięcy intensywnie testuję różne narzędzia wspomagające programowanie z pomocą sztucznej inteligencji. Czas na moje przemyślenia – subiektywne, bez owijania w bawełnę, c…
Użycie AI zmienia programowanie, ale czasmi robi nas w bambuko. W ostatnich miesiącach w społeczności programistów coraz częściej słyszy się o tzw. „vibe codingu”. To n…