Jak ostatnio pisałem o sędzim, który ocenia mój benchmark, zostawiłem jedną rzecz na boku. Bo tam opowiadałem o dokładaniu modelu do oceniania, a nie o tym, że model jest w tej cał…
Kiedy ostatnio pisałem o benchmarku (kod, który zabija przeglądarkę), przemilczałem nudną część. Szesnaście modeli, po sześć prób, jedno zadanie – to jest 96 plików HTML, któ…
Ostatnio grzebałem przy pluginie Refio i testowałem go na lokalnych modelach LLM. Teoretycznie wszystko działało: model miał dostać cały kontekst projektu – otwarte pliki z I…
Jest taki moment, kiedy model zwraca kod, plik się otwiera i przez dwie sekundy myślisz, że działa. Czasem faktycznie. A czasem karta przeglądarki zostaje pusta, albo wyskakuje bia…
Dawno nie było wpisu… na temat generowania grafiki. Ostatnio sobe siadłem fo starego codebase i porobiłem z ciekawości pipeline do kwantyzacji do modeli dyfuzyjnych – S…
Robię benchmark lokalnych modeli. Proste zadanie: zbuduj Todo App w jednym pliku HTML – dodawanie, kasowanie, oznaczanie, filtry, localStorage. Banał. Każdy model dostaje 6 p…
Prawdziwie praktyczny RAG? To nie jest tylko zbudowanie wektorowego indeksu i nadzieja, że LLM znajdzie wszystko sam. Gdy pracujesz nad projektem, liczysz na asystenta, który napra…
Claude Code to narzędzie terminalowe stworzone przez Anthropic, które pozwala programistom pracować z kodem przy pomocy języka naturalnego. Nie jest to zwykły czat, ale coś w rodza…
TL;DR: AI potrafi programować, ale to nie magiczne rozwiązanie. Najlepsze efekty daje jako „asystent”, którego kod trzeba dokładnie sprawdzać i stopniowo wdrażać. Stara szkoła code…
Moim zdaniem sztuczna inteligencja w 2025 roku rozwija się w błyskawicznym tempie. Za chwilę zobaczymy kolejne przełomowe technologie i modele, które zmieniają sposób, w jaki pracu…