CRODULocal LLM Benchmarkv3
llmbenchmark.crodus.ai

Local LLM Benchmark

Modele językowe uruchomione na własnym sprzęcie, przepuszczone przez sześć rodzajów zadań: ocenę długiego tekstu, stronę z mapą rysowaną grafiką wektorową, scenę trójwymiarową w przeglądarce, grę, baterię zadań tekstowych i baterię zadań na obrazach. Dla porównania te same zadania wykonały modele dostępne przez sieć. Identyczna treść polecenia, jedno podejście, zero poprawek po oddaniu. W środku zmierzone czasy, wyniki punktowe i wszystko, co powstało — do otwarcia w przeglądarce.

9
wykonawców
6
rodzajów zadań
120+
zmierzonych przebiegów
0
poprawek po oddaniu

Zakres testu.

Co sprawdzaliśmy, na czym i czego z tych liczb nie wolno wyczytać.

Pytanie było jedno: czy model językowy uruchomiony na własnym komputerze wykona pracę, którą dziś wykonują modele dostępne przez sieć. Pytanie ma sens wtedy, gdy sprzęt już stoi — wówczas każde wywołanie modelu zewnętrznego jest kosztem, a modelu lokalnego nie.

Żeby porównanie było uczciwe, wszyscy wykonawcy dostali dokładnie to samo. Treść polecenia była tym samym plikiem, przeniesionym między maszynami i sprawdzonym sumą kontrolną. Nikt nie widział, co zrobili inni. Nikt nie dostał wskazówki po drodze. Każdy miał jedno podejście, a to, co oddał, trafiło na serwer bez jednej poprawionej linii.

Wynik w trzech zdaniach

Skrót

Modele lokalne czytają dobrze i rysują źle. Na ocenie długiego tekstu i na pracy z dokumentami są szybkie i wystarczająco dokładne. Na dwunastu podejściach do zadań graficznych żadne nie dało wyniku, który dałoby się pokazać komuś z zewnątrz.

O wyniku decyduje nie rozmiar modelu, tylko to, czy wykonawca widzi, co zbudował. Dominujący błąd nie jest błędem w kodzie — kod jest poprawny, konsola milczy, a rysunek powstaje poza kadrem. Czytaniem kodu się tego nie znajdzie.

Więcej myślenia nie znaczy lepiej. Wyłączenie myślenia dawało ostrzejsze oceny tekstu niż włączenie, a jeden z modeli przy domyślnym poziomie wysiłku po czterech godzinach oddał zero znaków odpowiedzi.

Dwie części

Przegląd — cztery zadania rozdane wszystkim dziewięciu wykonawcom: ocena dokumentów, strona z mapą, scena trójwymiarowa i gra przeglądarkowa. Każdy dostał wszystkie cztery, w każdym trybie, jaki jego model obsługuje.

Bateria — zestaw zadań biurowych puszczony przez trzy modele z ekspertami, które z przeglądu wyszły najlepiej: pięć zadań tekstowych, trzy na obrazach, test wywoływania narzędzi, test wytrzymałości, prosta gra i porównanie modelu przed kwantyzacją i po niej.

Bateria jest konsekwencją przeglądu: z dziewięciu wykonawców do dalszego sprawdzania kwalifikowały się tylko modele z ekspertami, więc zamiast powtarzać całość, sprawdziliśmy tę trójkę głębiej i na pracy bliższej temu, do czego takie modele realnie się nadają.

Czego z tych liczb nie wolno wyczytać

Każdy wynik pochodzi z jednego podejścia. Żadna liczba nie jest średnią, więc różnica rzędu kilku procent nie jest różnicą. Ten sam model zapytany dwa razy o to samo odpowie za każdym razem inaczej — to cecha konstrukcji, nie usterka. Test nie sprawdzał też trybu, w którym takie modele pracują na co dzień: rozmowy w kilku turach, z poprawkami.

Metoda.

Stanowisko, zadania i sposób pomiaru.

Model językowy

Program, który dostaje tekst i dopisuje do niego ciąg dalszy. Nie wyszukuje gotowych odpowiedzi w bazie — wylicza każde kolejne słowo. Dlatego wynik pojedynczego podejścia nigdy nie jest dowodem na to, co model umie w ogóle.

Stanowisko

Modele lokalne chodziły na komputerze z układem graficznym NVIDIA GB10 i stu dwudziestoma ośmioma gigabajtami pamięci dzielonej między procesor a układ graficzny. Oprogramowanie serwujące: vLLM w obrazie przypiętym do konkretnej wersji, ten sam dla wszystkich modeli, żeby różnica w wyniku nie brała się z różnicy w środowisku.

Przy przeglądzie maszyna obsługiwała jeden duży model naraz; każda zmiana oznaczała wyładowanie modelu i wczytanie następnego, co samo w sobie zajmuje od czterech do jedenastu minut. Przy baterii okazało się, że dwa modele stoją obok siebie na jednej takiej maszynie bez problemu, pod jednym warunkiem — muszą wczytywać się po kolei, a nie równolegle. Puszczone równolegle ścigają się o pamięć i drugi pada na braku miejsca na pamięć kontekstu.

Cztery zadania przeglądu

Bateria

Bateria sprawdza nie to, czy model zbuduje stronę, tylko czy nadaje się do pracy biurowej: czytania długich materiałów, wyciągania z nich ustaleń, trzymania narzuconego formatu, odczytu zrzutów ekranu i wywoływania narzędzi. Pełny opis zadań w zakładce Bateria.

Co mierzyliśmy

Czas od wysłania polecenia do ostatniego znaku odpowiedzi. Długość odpowiedzi i osobno długość samego rozumowania. Powód zakończenia — czy model skończył, bo powiedział wszystko, czy dlatego, że wyczerpał przyznany budżet. Przy zadaniach graficznych dodatkowo: czy strona otwiera się bez błędu w konsoli przeglądarki, czy widać to, co miało być widać, i czy da się tym sterować.

Konsola przeglądarki

Miejsce, w którym przeglądarka wypisuje błędy strony. Zwykły użytkownik jej nie otwiera i widzi tylko skutek: pusty ekran albo brakujący element. To jedyny sposób odróżnienia strony, która się psuje, od strony, która działa, tylko wygląda źle.

Czego nie mierzyliśmy

Zużycia prądu ani obciążenia maszyny. Przebiegów nie powtarzaliśmy. Grywalności nie oceniała zdalna przeglądarka wciskająca syntetyczne klawisze — ta metoda cztery razy z rzędu dała werdykt niezgodny z tym, co widać na ekranie. Z automatu raportujemy wyłącznie błędy konsoli i to, co widać na zrzucie; o tym, czy grą da się grać, rozstrzyga człowiek, otwierając ją u siebie.

Uczestnicy.

Sześć modeli na własnym sprzęcie, trzech wykonawców na modelach dostępnych przez sieć.

Modele lokalne

modelrozmiarsterowanie myśleniem
Qwen 3.6-35B-A3B35 mld, z ekspertamiwłącz / wyłącz
Qwen 3.8-27B27 mld, gęstywłącz / wyłącz oraz trzy poziomy wysiłku
Gemma 4 26B-A4B26 mld, z ekspertamiwłącz / wyłącz
Gemma 4 31B31 mld, gęstywłącz / wyłącz
Qwen3-Coder-Next80 mld, 512 ekspertówbrak — model nie ma takiej możliwości
Ornith 1.0-35B35 mld, z ekspertamiwłącz / wyłącz
Ornith 1.5-35B-A3B35 mld, z ekspertamiwłącz / wyłącz
Ornith 1.5-35B-A3B FP8ten sam model skwantyzowany na miejscuwłącz / wyłącz
Model z ekspertami

Konstrukcja, w której model ma bardzo dużo parametrów, ale przy każdym słowie używa tylko małej ich części. Waży jak duży, liczy jak mały. W tabeli to pozycje z dwiema liczbami w nazwie — pierwsza mówi, ile waży, druga, ile realnie pracuje przy każdym słowie.

Myślenie modelu

Tryb, w którym model przed właściwą odpowiedzią pisze dla siebie rozumowanie — użytkownik go nie widzi, ale model zużywa na nie czas i przyznany budżet. Bywa, że pomaga; bywa też, że model zapętla się w rozważaniach i wyczerpuje cały budżet, nie napisawszy ani słowa odpowiedzi.

Sterowania myśleniem nie da się odgadnąć

Ani z nazwy modelu, ani z dokumentacji producenta. Trzeba zajrzeć do szablonu rozmowy, który każdy model niesie ze sobą, i sprawdzić, jakie przełączniki są w nim obsłużone. Przy Qwenie 3.8 kosztowało to cztery godziny: model ma trzy poziomy wysiłku, domyślnym jest najwyższy, a pierwsze podejście do strony z mapą wyprodukowało dwieście czterdzieści sześć tysięcy znaków rozumowania i ani jednej linii kodu.

Wykonawcy na modelach zewnętrznych

wykonawcatryb pracyzadania
gpt-6-astra, agent z pętlą kontroli czyta polecenie z pliku, pisze kod u siebie, uruchamia go w przeglądarce, ogląda wynik i poprawia strona z mapą, scena 3D, gra
Claude / Opus wersja wzorcowa strony, działająca na produkcji strona z mapą, scena 3D, gra
Claude / Fable model nastawiony na dłuższe, samodzielne pisanie kodu gra
Na czym polega to porównanie

Modele lokalne pisały w ciemno — jedno podejście, bez możliwości obejrzenia własnego wyniku. Agent na modelu zewnętrznym widział, co zbudował, i miał prawo poprawić. Różnica w wynikach pokazuje, ile w tej pracy waży sam model, a ile możliwość sprawdzenia siebie.

Zadanie: ocena dokumentów.

Pięćdziesiąt pięć tysięcy znaków do przeczytania, streszczenia i oceny z werdyktem.

Materiałem były trzy dokumenty handlowe. Polecenie mówiło wprost, że ocena ma być szorstka, bez uprzejmości i bez podsumowań w rodzaju „ogólnie dobry dokument”, z dosłownymi cytatami i jednym z trzech werdyktów. Zadanie sprawdza czytanie ze zrozumieniem, zdolność do znalezienia sprzeczności wewnątrz długiego materiału i gotowość do wystawienia oceny negatywnej.

model i trybczasodpowiedźcytatywerdykt
Qwen 3.6 bez myślenia67 s9 185 zn27nie nadaje się
Qwen 3.6 z myśleniem134 s4 881 zn11po poprawkach
Qwen 3.8 bez myślenia8 min 42 s12 453 zn74nie nadaje się
Qwen 3.8 poziom low14 min 18 s12 138 zn84nie nadaje się
Qwen 3.8 poziom medium16 min 30 s15 951 zn83po poprawkach
Qwen 3.8 poziom xhigh35 min0 znbrak odpowiedzi
Gemma 4 26B bez myślenia58 s5 117 zn30nie nadaje się
Gemma 4 26B z myśleniem1 min 33 s4 132 zn21po poprawkach
Gemma 4 31B bez myślenia4 min 23 s4 837 zn22nie nadaje się
Gemma 4 31B z myśleniem7 min 40 s5 303 zn28nie nadaje się
Qwen3-Coder-Next1 min 18 s9 608 zn
Ornith 1.0 bez myślenia1 min 41 s8 382 zn
Ornith 1.0 z myśleniem3 min 6 s17 771 zn

Jedyny przebieg bez odpowiedzi

Qwen 3.8 na najwyższym poziomie wysiłku po trzydziestu pięciu minutach wyczerpał budżet na samym rozumowaniu — pięćdziesiąt trzy tysiące znaków rozważań i zero znaków odpowiedzi. Ten sam wzorzec zabił wcześniej jego podejście do strony z mapą.

Wyłączone myślenie dawało ostrzejsze oceny

Trzy modele — oba Qweny i Gemma 4 26B — bez myślenia wystawiły ocenianemu dokumentowi werdykt „nie nadaje się”, a z myśleniem złagodziły go do „nadaje się po poprawkach”. Wyjątkiem jest Gemma 4 31B, która w obu trybach została przy werdykcie negatywnym. Rozumowanie na tekście służy modelowi głównie do szukania okoliczności łagodzących.

Co dało się z tego wyciągnąć

Wartością tego zadania nie jest tabela, tylko treść zarzutów. Modele wyłapały wewnętrzne sprzeczności między okładką a stopką tego samego dokumentu, twierdzenia niepoparte materiałem dowodowym w tym samym pliku, kluczowe pojęcie użyte kilkadziesiąt razy i nigdzie nie zdefiniowane, oraz sekcję zakazów bez odpowiadającej jej sekcji dopuszczalnych odpowiedzi. Kilka z tych zarzutów nie padło wcześniej z ust żadnego człowieka, który ten materiał czytał. Na tym zadaniu model lokalny jest realnie użyteczny.

Zadanie: strona z mapą i scena 3D.

Dwanaście podejść modeli lokalnych do zadania, o którym wiadomo, że jest wykonalne.

Zadanie było uczciwe w tym sensie, że wzorzec istnieje: strona z tej samej treści polecenia została wcześniej zbudowana przez model zewnętrzny i działa na produkcji. Wiadomo więc, że polecenie jest wykonalne i że da się z niego zbudować to, co opisuje.

Grafika wektorowa na stronie

Sposób rysowania obrazków w przeglądarce poleceniami „narysuj linię stąd dotąd”, „narysuj prostokąt tej wielkości”. Obrazek nie jest zdjęciem, tylko zestawem instrukcji. Przewaga: skaluje się bez utraty ostrości. Trudność: jeśli model pomyli skalę albo układ współrzędnych, rysunek powstaje poprawnie, tylko poza widocznym obszarem — i widz ma pusty ekran przy zupełnie zdrowym kodzie.

model i trybwersja z mapąscena 3D
Qwen 3.6 z myśleniemrysuje pas mapy, brak zabudowy, dymki odklejone od punktówkopuła klocków zamiast wyspy, etykiety w stosie
Qwen 3.6 bez myśleniawywraca się przy pierwszej etykieciekamera wewnątrz zabudowy
Qwen 3.8 bez myśleniawywraca się przy trzecim obiekciepionowy stożek z kulką
Qwen 3.8 poziom lowdziała, konsola czysta, zabudowa ubogawyspa z zabudową i rzeką, kamera za blisko
Qwen 3.8 poziom mediumbrak wyniku po 3 h 24 minwyspa z rzeką, ani jednego budynku
Qwen 3.8 poziom xhighbrak wyniku po 4 hbrak wyniku
Gemma 4 26B bez myśleniapusta płaszczyzna, kilka punktówpusty obszar pod tekstem
Gemma 4 26B z myśleniemnajlepszy nagłówek strony w stawce, mapa pusta, etykiety ucięte za krawędziąpusty obszar, układ nawigacji odbity
Gemma 4 31B bez myśleniarzeka, ulice, zabudowa i dziesięć etykiet, mapa ucieka za prawą krawędźzabudowa obecna, całość przechylona
Gemma 4 31B z myśleniemmiasto, dymki z podpisami, licznik dolicza do jedenastu, całość mała i tonie w szarościzabudowa obecna, skala rozjechana
Qwen3-Coder-Nextnajdłuższy kod całego testu, wynik nieczytelnynieczytelny
Ornith 1.0, oba trybynieczytelnynieczytelny
Ornith 1.5 bez myśleniakompletny plik w 11 minzapętlenie: osiem razy zaczyna plik od nowa
Ornith 1.5 z myśleniemkompletny plikkompletny plik, skończył sam
gpt-6-astra, agentpełna treść, przełącznik widoków, etapy przy przewijaniu; mapa nie pojawia się w kadrzejeden dokument z obiema wersjami
Claude / Opus (wzorzec)działadziała

Dwanaście podejść modeli lokalnych, z czego dwa doszły do czegoś, co przypomina mapę miasta, a dziesięć nie. Żadne nie nadaje się do pokazania. Przy patrzeniu wyłącznie na siebie nawzajem łatwo uznać najmniej złe podejście za dobre — miarą jest strona, która działa, nie reszta stawki.

Jeden błąd powtarza się u wszystkich

Niezależnie od modelu, rozmiaru i trybu myślenia wzorzec porażki jest ten sam: treść i układ powstają poprawnie, a rysunek powstaje poza kadrem. Zabudowa jest w kodzie, tylko w skali stukrotnie za małej. Etykiety są, tylko za lewą krawędzią. Kamera jest ustawiona, tylko wewnątrz bryły albo pod nią. Konsola w większości przypadków milczy, bo z punktu widzenia przeglądarki nic złego się nie dzieje. Model sprawdza kod przez czytanie kodu, a kod jest poprawny.

Agent, który widzi swój wynik

Wykonawca na gpt-6-astra oddał obie wersje strony z pełną treścią, przełącznikiem między widokami, etapami pojawiającymi się przy przewijaniu i kartami tematycznymi zmieniającymi się przy każdym etapie. Sprawdzał swoją pracę w przeglądarce i poprawiał to, co znalazł.

Na jednym elemencie ta kontrola nie zadziałała — narzędzie do analizy obrazu odmówiło mu dostępu, więc układ sprawdzał przez odczytanie struktury dokumentu zamiast przez patrzenie. I dokładnie tam wynik jest taki sam jak u modeli lokalnych: mapa nie pojawia się w kadrze, a licznik obiektów stoi na zerze. Granica przebiega nie między modelami, tylko między widzeniem wyniku a czytaniem kodu.

Zadanie: gra przeglądarkowa.

Najostrzejsze z zadań, bo wynik albo da się uruchomić i przejechać, albo nie.

Gra sprawdza coś, czego trzy poprzednie zadania nie sprawdzają. Dokument można ocenić po przeczytaniu, stronę po obejrzeniu, ale grę trzeba uruchomić i pojechać. Jeśli pociąg nie rusza, nie ma znaczenia, jak wygląda stacja.

wykonawcaco powstało
gpt-6-astra, agentwyspa, drzewa, most, szyld stacji, ludzie na peronie, panel sterowania, karta wprowadzająca. Najlepsza grafika całego testu; jazda szarpana
Claude / Fabletramwaj na szynach, peron z markizą i kolejką ludzi, wyspy w tle, most wygięty w dal, pełne przyrządy. Najlepsza grywalność i najwierniejsze odtworzenie polecenia
Claude / Opusscena warsztatu, tor, system komfortu; całość słaba
Gemma 4 26B bez myśleniajedzie, grafika uboga — jedyna lokalna, którą da się przejechać
Gemma 4 26B z myśleniemkomplet przyrządów i napisów, warsztat z przyciskami ulepszeń, świata nie widać
Gemma 4 31B bez myśleniawywraca się na starcie: zadeklarowana zmienna o nazwie zarezerwowanej przez przeglądarkę
Gemma 4 31B z myśleniemwyspa, domy, latarnia morska, przyrządy działają; jazdy nie ma
Qwen 3.6, oba trybywyjątek w pętli rysowania — tor jest pustą krzywą
Qwen 3.8 bez myśleniaładna karta startowa i koniec: użyte polecenie nie istnieje w bibliotece, którą sam wczytał
Qwen 3.8 poziom lowprzyrządy się rysują, scena nie
Qwen 3.8, poziomy medium i xhighnic nie oddały
Qwen3-Coder-Nextekran startowy z przyciskiem, który nic nie robi
Ornith 1.0 bez myśleniakamera wewnątrz bryły terenu
Ornith 1.0 z myśleniemokno warsztatu z czterema ulepszeniami z polecenia, scena ciemna i pusta
Ornith 1.5 bez myśleniakompletny plik w 10 minut
Ornith 1.5 z myśleniemprzebieg przerwany przed oddaniem wyniku

Dwa wyniki warte uwagi

Agent zbudował jedyny świat, po którym widać, że ktoś czytał opis miasteczka: wyspa ma kształt, peron ma szyld z nazwą stacji, na peronie stoją ludzie, a most prowadzi gdzieś dalej. Jazda jest jednak szarpana — pociąg skacze zamiast płynąć po torze, czyli ta część zadania, która mówiła o wrażeniu jazdy, wypadła najsłabiej.

Fable zrobił odwrotnie: najlepiej odtworzył drobiazgi polecenia — liczbę pasażerów, pasek komfortu, warunki na trasie, przyciski mocy i hamulca, przycisk warsztatu — i najlepiej trafił w to, jak taka gra ma się prowadzić. Obciążył za to pierwszą klatkę cieniami: dwie mapy cieni 2048 × 2048 z miękkim filtrowaniem, dziewięćset instancji chmur oraz szyny, podkłady i słupy, wszystko rzucające cień. Na maszynie z mocnym układem graficznym jest grywalne, na słabszej się zacina.

Najlepszy możliwy wynik to grafika i świat od pierwszego wykonawcy połączone z silnikiem jazdy i dbałością o szczegóły od drugiego. Żaden pojedynczy przebieg tego nie osiągnął.

Dlaczego gry wywracają się częściej niż strony

Strona, która rysuje się źle, nadal się wyświetla. Gra, która rysuje się źle, przestaje być grą. Dochodzi do tego pętla — kod wykonywany sześćdziesiąt razy na sekundę. Jeden błąd w tej pętli zatrzymuje wszystko, i właśnie tam wywróciły się oba przebiegi Qwena 3.6: tor został zbudowany jako pusta krzywa, a pętla przy pierwszym obrocie pyta tę krzywą o punkt, którego nie ma.

Drugi powtarzalny błąd to sięganie po polecenia, których w użytej bibliotece nie ma. Model pamięta nazwę z innej wersji, wpisuje ją, i strona umiera przy starcie. Qwen 3.8 bez myślenia i Gemma 4 31B bez myślenia poległy na tym, każdy na innym poleceniu.

Prostsze zadanie

Trzy modele z baterii dostały zadanie celowo najprostsze z możliwych — ładna mapa, po której chodzi ludzik, żadnych przeciwników, punktów ani poziomów. Chodziło o sprawdzenie, czy porażki na kolejce brały się z modelu, czy ze złożoności zadania. Wyniki otwierają się i renderują, ale żaden nie jest tym, co opisywało polecenie: grafika i sterowanie pozostają słabym punktem wszystkich trzech. Czasy w zakładce Bateria.

Bateria modeli z ekspertami.

Praca biurowa zamiast budowania stron.

Po przeglądzie było jasne, że do dalszego sprawdzania wchodzą wyłącznie modele z ekspertami: gęste kosztują pięciokrotnie więcej czasu przy tej samej albo gorszej jakości. Zostały trzy — Qwen 3.6-35B-A3B, Gemma 4 26B-A4B i Ornith 1.5-35B-A3B — i te trzy przeszły baterię zbudowaną z materiałów roboczych: automatycznego transkryptu spotkania, zgłoszenia usterki technicznej, dokumentów handlowych i zrzutów ekranu z przeglądu.

Pięć zadań tekstowych

kodzadaniemateriałbudżetco sprawdza
z1Wypisz wszystkie ustalenia ze spotkania: co · kto odpowiada · termintranskrypt automatyczny, bez korekty, 26 506 zn8 000 tokwyciąganie faktów z surowego zapisu z przekręconymi nazwiskami
z2Pięć pytań, w tym dwa, na które w materiale nie ma odpowiedziten sam transkrypt2 000 tokczy model przyzna „brak w materiale”, czy zmyśli prawdopodobnie brzmiącą odpowiedź
z3Zamień zgłoszenie na JSON o dokładnie dziesięciu polachzgłoszenie usterki technicznej, 8 657 zn2 000 toktrzymanie narzuconego formatu co do pola, bez otoczki i bez komentarza
z4Napisz odpowiedź do zgłaszającego, po ludzku, maksymalnie pięć zdańto samo zgłoszenie1 500 toktłumaczenie treści technicznej na nietechniczną i trzymanie limitu długości
z5Streść i oceń bez taryfy ulgowej trzy dokumenty handlowe55 156 zn16 000 tokto samo co jedno z zadań przeglądu, dla porównywalności

Wyniki — budżet standardowy

model / trybz1 ustaleniaz2 pułapkaz3 formatz4 pismoz5 ocena
Qwen 3.6 · bez16 s · 1 488 zn5/5 · 2 szgodny · 8 s3 s · 418 zn84 s · 10 762 zn
Qwen 3.6 · myśli103 s · 1 754 zn0/5 · budżetbrak · budżetbrak · budżet157 s · 7 237 zn
Gemma 4 26B · bez15 s · 737 zn5/5 · 7 szgodny · 9 s3 s · 364 zn54 s · 5 046 zn
Gemma 4 26B · myśli154 s · 713 zn5/5 · 44 sbrak · budżetbrak · budżet103 s · 4 916 zn
Ornith 1.5 · bez33 s · 2 333 zn5/5 · 4 szgodny · 13 s8 s · 667 zn131 s · 11 453 zn
Ornith 1.5 · myślibrak · budżet5/5 · 60 szgodny · 61 sbrak · budżet570 s · 7 245 zn
Ornith 1.5 FP8 · bez43 s · 4 338 zn5/5 · 3 szgodny · 10 s6 s · 688 zn95 s · 10 525 zn
Ornith 1.5 FP8 · myślibrak · budżet0/5 · budżetbrak · budżetbrak · budżet456 s · 9 241 zn

„budżet” znaczy, że model zużył cały przyznany limit na samo rozumowanie i skończył, nie napisawszy odpowiedzi. To nie jest zerowy wynik merytoryczny, tylko zderzenie trybu myślenia z limitem dwóch tysięcy tokenów.

Ten sam zestaw z budżetem pięciokrotnie większym

model (tryb myślenia)z2 pułapkaz3 formatz4 pismow2 pusta stronaw3 strona wzorcowa
Qwen 3.65/5zgodnynapisanetrafnetrafne
Gemma 4 26B5/5zgodnynapisanetrafnebłędne
Ornith 1.55/5zgodnynapisanetrafnetrafne
Ornith 1.5 FP85/5zgodnybrak · budżettrafnetrafne
Wniosek praktyczny

Prawie wszystkie porażki trybu myślenia z tabeli wyżej znikają, gdy modelowi da się pięciokrotnie większy limit. Budżet odpowiedzi jest ustawieniem zapytania, nie modelu, a rozumowanie konsumuje ten sam limit co odpowiedź. Konfiguracja, która włącza myślenie na limicie dobranym do trybu bez myślenia, produkuje puste odpowiedzi, które łatwo wziąć za awarię modelu.

Trzy zadania na obrazach

kodobrazpolecenie
w1strona dokumentu z tabelą wyników przegląducztery pytania o zawartość tabeli: liczba wierszy z danymi, który wiersz ma w kolumnie odpowiedź wartość zero, wartość w konkretnej komórce, werdykt w konkretnym wierszu
w2zrzut strony, na której mapa nie narysowała się w kadrzeczy opisana mapa jest widoczna, co konkretnie widać w jej miejscu, czy stronę da się pokazać odbiorcy
w3zrzut strony wzorcowej, na której mapa jestto samo — oczekiwana odpowiedź przeciwna

w2 i w3 to para: model, który na wszystko odpowiada „tak, widać”, zdobywa punkt na jednym i traci na drugim. Sprawdzamy patrzenie, nie uprzejmość.

model / trybw1 odczyt tabeliw2 pusta stronaw3 strona wzorcowa
Qwen 3.6 · bez3/4 · 5 strafne · 4 strafne · 3 s
Qwen 3.6 · myślibrak · budżettrafne · 25 strafne · 20 s
Gemma 4 26B · bez1/4 · 1 strafne · 3 strafne · 2 s
Gemma 4 26B · myślibrak · budżettrafne · 22 sbłędne · budżet
Ornith 1.5 · bez4/4 · 6 strafne · 12 strafne · 5 s
Ornith 1.5 · myśli4/4 · 28 strafne · 29 sbłędne · 37 s
Ornith 1.5 FP8 · bez4/4 · 5 strafne · 8 strafne · 4 s
Ornith 1.5 FP8 · myśli4/4 · 15 strafne · 24 strafne · 29 s

Odczyt tabeli ze zrzutu rozdzielił tę trójkę mocniej niż cokolwiek innego: Ornith 4/4 w każdym trybie, Qwen 3/4, Gemma 1/4. Wszystkie trzy mają wzrok, ale tylko jeden czyta nim liczby na tyle wiernie, żeby oprzeć na tym pracę z dokumentami.

Wywoływanie narzędzi

Trzy narzędzia: wypisz zadania z projektu, przeczytaj zadanie, dopisz komentarz. Model dostaje polecenie w jednym zdaniu, a odpowiedzi narzędzi są przygotowane z góry. Liczy się, czy wywoła właściwe narzędzia we właściwej kolejności, poda właściwe argumenty i zamelduje prawdę o tym, co zrobił.

modelbez myśleniaz myśleniemwynik
Qwen 3.65 s14 skomplet, poprawnie
Gemma 4 26B5 s15 skomplet, poprawnie
Ornith 1.511 s20 skomplet, poprawnie
Ornith 1.5 FP89 s10 skomplet, poprawnie

Cztery na cztery, w obu trybach, w tej samej kolejności wywołań. Różnica jest w tonie meldunku: Qwen i Gemma odpowiadają jednym zdaniem, Ornith rozpisuje się na punkty i cytuje treść komentarza.

Test wytrzymałości

Sto zapytań pod rząd, mieszanych co do długości i rodzaju, co siódme z włączonym myśleniem, z automatycznym wykrywaczem uszkodzonej odpowiedzi: pusta odpowiedź, zbyt mały udział liter, powtarzające się znaczniki rozumowania, długie ciągi jednego znaku, ciągi znaków ramek.

modelczysteśredni czasco się zepsuło
Ornith 1.5 FP896 / 1009,3 scztery puste odpowiedzi, wszystkie w trybie myślenia, wszystkie z wyczerpanego budżetu — ani jednego uszkodzonego tekstu

Ten test powstał po kwantyzacji, żeby wykluczyć uszkodzenie modelu: model uszkodzony przy kwantyzacji po stu zapytaniach sypie znakami ramek i powtórkami. Tu nie wystąpił ani jeden taki przypadek.

Gra: ludzik na mapie

modelbez myśleniaz myśleniem
Qwen 3.6133 s · 17 423 zn245 s · 32 007 zn
Gemma 4 26B124 s · 11 602 zn168 s · 10 844 zn
Ornith 1.5305 s · 22 108 zn1 256 s · 22 394 zn
Ornith 1.5 FP8315 s · 32 332 zn970 s · 23 757 zn

Ornith 1.5 na trzech zadaniach przeglądu

Ornith 1.5 FP8 dostał później te same trzy zadania graficzne co uczestnicy przeglądu — mapę, scenę trójwymiarową i grę — z identyczną treścią polecenia.

zadanie i trybczasco oddałpowód zakończenia
mapa · bez myślenia11 min46 588 zn kodu, plik domkniętyskończył sam
mapa · z myśleniem66 min52 948 zn kodu, plik domknięty; 222 195 zn rozumowaniawyczerpany budżet
scena 3D · bez myślenia69 minosiem razy zaczął ten sam plik od nowa, razem 315 708 znwyczerpany budżet
scena 3D · z myśleniem43 min55 331 zn kodu, plik domknięty; 160 136 zn rozumowaniaskończył sam
gra · bez myślenia10 min50 290 zn kodu, plik domkniętyskończył sam
gra · z myśleniemprzebieg przerwany przed oddaniem wyniku
Dwie rzeczy, których nie było w przeglądzie

Zapętlenie zamiast wywrotki. Na scenie 3D bez myślenia model nie napisał błędnego kodu — napisał ten sam plik osiem razy. Polecenie mówiło o jednym pliku w jednym bloku. Publikujemy pierwszy blok, jedyny domknięty; pozostałe siedem to powtórki. To inny rodzaj porażki niż wszystko, co dał przegląd, gdzie kod powstawał raz i wywracał się w przeglądarce.

Tu myślenie pomagało. Na obu zadaniach graficznych wersja z myśleniem wypadła lepiej niż bez: obie domknięte, scena 3D nawet szybciej. Przegląd pokazywał zależność odwrotną. Przy tym modelu ona nie obowiązuje.

Budżet odpowiedzi w tych przebiegach wynosił 120 000 tokenów — tyle samo, co u pozostałych uczestników, dla porównywalności. Okno kontekstu modelu jest ponad dwa razy większe, więc tam, gdzie w tabeli stoi „wyczerpany budżet”, jest to sufit ustawienia zapytania, a nie granica możliwości modelu.

Kwantyzacja FP8.

Jedyny model w zestawie bez gotowej wersji skwantyzowanej — i to, czego nie ma w żadnej instrukcji.

Kwantyzacja FP8

Sposób zapisania modelu mniejszą liczbą bitów na każdą wartość — z dwóch bajtów do jednego. Model zajmuje wtedy około połowy miejsca i liczy szybciej, kosztem drobnej utraty dokładności. Wszystkie pozostałe modele w tym teście przyszły już w takiej postaci od producenta.

Po co

Ornith wypadł w baterii najlepiej z całej trójki, ale w pełnej precyzji zajmował tyle pamięci, że nie mieścił się obok drugiego modelu z sensownym oknem kontekstu. Pytanie brzmiało: czy da się go zmniejszyć o połowę bez utraty tego, za co został wybrany.

Dwie ślepe uliczki

Awaria, która wyjaśniła całą resztę

Druga próba dała model kompletny, wczytujący się poprawnie — i produkujący śmieci: powtarzające się znaczniki rozumowania, niemieckie słowa w polskiej odpowiedzi, długie ciągi znaków ramek. Model, który prawie działa, jest gorszy od modelu, który nie wstaje.

Przyczynę widać dopiero w spisie warstw: trzydzieści z czterdziestu warstw tej architektury to nie klasyczna uwaga, tylko warstwy stanowe — inna konstrukcja, z własnymi macierzami i parametrami czasowymi. Kwantyzator traktował je jak zwykłe warstwy liniowe i psuł im skalę. Poprawka to rozszerzenie listy pominięć o te warstwy, o eksperta współdzielonego, o bramkę wyboru ekspertów i o całą wieżę wizyjną.

Przepis, który zadziałał

Schemat FP8_DYNAMIC na warstwach liniowych, bez danych kalibracyjnych, z pominięciem: głowicy wyjściowej, wszystkich warstw stanowych, eksperta współdzielonego, bramki wyboru ekspertów, całej wieży wizyjnej i warstw predykcji wielotokenowej. Czas przeliczenia: 269 sekund. Wynik: 36 GB na dysku, przy dwukrotnie większej wersji wyjściowej.

Ile to kosztowało jakości

sprawdzianpełna precyzjaFP8
z2 pułapka (bez / myśli)5/5 · 5/55/5 · budżet
z3 format JSON (bez myślenia)zgodnyzgodny
w1 odczyt tabeli (bez / myśli)4/4 · 4/44/4 · 4/4
w3 strona wzorcowa (z myśleniem)błędnetrafne
wywoływanie narzędzikompletkomplet
sto zapytań pod rządnie robiony96/100 czystych

Przepustowość — znaki na sekundę, ten sam sprzęt

przebiegpełna precyzjaFP8różnica
z1 ustalenia, bez myślenia71 zn/s101 zn/s+42 %
z5 ocena dokumentów, bez myślenia87 zn/s111 zn/s+27 %
z5 ocena dokumentów, z myśleniem108 zn/s136 zn/s+26 %
gra, bez myślenia73 zn/s103 zn/s+41 %
gra, z myśleniem83 zn/s108 zn/s+30 %

Liczone razem z rozumowaniem, bo ono też jest pracą modelu. Wcześniejsze wrażenie, że Ornith jest wolny, brało się z pomiaru czasu zamiast prędkości: on nie jest wolny, tylko gadatliwy. Przy tej samej prędkości pisania oddaje dłuższą odpowiedź.

Bilans

Identyczne wyniki punktowe, o jedną odpowiedź lepiej na zadaniu wizualnym, od dwudziestu sześciu do czterdziestu dwóch procent szybciej i dwa razy więcej miejsca na pamięć kontekstu przy tym samym udziale pamięci. Przy tej architekturze cena kwantyzacji jest w praktyce zerowa — pod warunkiem pominięcia warstw stanowych.

Czasy.

Cztery modele przepuszczone przez identyczne stanowisko, od najszybszego do najwolniejszego.

Poniższe cztery modele przeszły wszystkie cztery zadania przeglądu na tym samym stanowisku, w identyczny sposób. Przy modelach z dwoma trybami podane są dwie liczby: bez myślenia i z myśleniem. Oba tryby jednego zadania liczyły się równolegle, więc czas całego przeglądu jest krótszy niż suma pozycji.

modeldokumentymapascena 3Dgracały przegląd
Gemma 4 26B-A4B58 s / 93 s4 min / 6 min4 min / 6 min3 min / 4 min17 min
Qwen3-Coder-Next78 s9 min5 min4 min19 min
Ornith 1.0 35B101 s / 186 s14 min / 15 min13 min / 15 min5 min / 9 min42 min
Gemma 4 31B4 min / 8 min33 min / 32 min24 min / 31 min15 min / 19 min92 min

Dwa modele z ekspertami zamknęły komplet w niecałe dwadzieścia minut. Gemma 4 31B, model gęsty o zbliżonej liczbie parametrów, potrzebowała pięć razy tyle. To różnica konstrukcji, nie jakości: model z ekspertami przy każdym słowie używa ułamka swoich parametrów.

Qweny przechodziły przez wcześniejszy, mniej jednolity zestaw pomiarów, więc ich czasów nie da się zestawić w tej samej tabeli. Rzędy wielkości: Qwen 3.6 z myśleniem zbudował mapę w trzydzieści pięć minut, Qwen 3.8 bez myślenia w pięćdziesiąt osiem minut, na poziomie low w pięćdziesiąt pięć. Na poziomie medium ta sama mapa zajęła trzy godziny dwadzieścia cztery minuty i nie powstała, a na poziomie xhigh — cztery godziny i również nie powstała.

Ile kodu powstało

Liczba znaków kodu nie mówi nic o jakości, ale pokazuje charakter modelu. Najwięcej napisał Qwen3-Coder-Next: siedemdziesiąt jeden tysięcy znaków na mapę i pięćdziesiąt siedem tysięcy na scenę 3D, przy zerowym efekcie widocznym na ekranie. Najmniej Gemma 4 26B — dwadzieścia pięć tysięcy. Wersje bez myślenia konsekwentnie produkowały więcej kodu niż wersje z myśleniem u tego samego modelu, i częściej ten kod się wywracał.

Bateria: prędkość pisania

W baterii mierzyliśmy to samo inaczej — znakami na sekundę, licząc razem odpowiedź i rozumowanie. Zestawienie przed kwantyzacją i po niej jest w zakładce Kwantyzacja. Rząd wielkości dla wszystkich trzech modeli na tym sprzęcie: od siedemdziesięciu do stu czterdziestu znaków na sekundę, zależnie od modelu, trybu i długości materiału wejściowego.

Charakter modeli.

Czym każdy okazał się w praktyce i do czego się w tym teście nadał.

lokalny · z ekspertami
Qwen 3.6-35B-A3B

Szybki na tekście — sześćdziesiąt siedem sekund na ocenę pięćdziesięciu pięciu tysięcy znaków — i jako jedyny wyłapał w ocenianym materiale barierę językową, której nie zauważył żaden inny model. W baterii: pułapka 5/5, format JSON zgodny, odczyt tabeli 3/4, wywoływanie narzędzi bez zarzutu.

Na kodzie graficznym bezradny w obu trybach: tor gry zbudował jako pustą krzywą, a mapa bez myślenia wywraca się przy pierwszej etykiecie. Najlepszy stosunek jakości do czasu przy czytaniu i ocenie tekstu.

lokalny · gęsty
Qwen 3.8-27B

Trzy poziomy wysiłku, z których domyślny jest najwyższy. Im więcej myślenia, tym gorzej: poziom low działa i dał najlepszą z Qwenowych scen 3D, medium potrafi po trzech godzinach oddać zero kodu, a xhigh nie oddał niczego w żadnym z trzech zadań.

Na tekście poziom medium dał najbogatszą analizę całego testu, ale kosztowała szesnaście i pół minuty tam, gdzie Gemma 26B potrzebowała minuty. Uruchamianie go bez jawnego ustawienia poziomu na low jest błędem.

lokalny · z ekspertami
Gemma 4 26B-A4B

Najszybszy model całego testu i najlepszy czytelnik. Cały przegląd w siedemnaście minut. Na dokumentach podniosła zarzuty, których nie podniósł nikt inny — sprzeczność wewnętrzną, niezdefiniowane pojęcie kluczowe i brak bezpiecznych odpowiedzi tam, gdzie materiał wymienia same zakazy.

Jej wersja gry jest jedyną wśród modeli lokalnych, którą da się przejechać, choć wygląda ubogo. Słabość odsłoniła bateria: odczyt tabeli ze zrzutu 1/4, najgorzej z całej trójki. Czyta tekst świetnie, obrazki słabo.

lokalny · gęsty
Gemma 4 31B

Jedyny model lokalny, który narysował coś przypominającego mapę miasta: rzeka, ulice, zabudowa i dziesięć etykiet miejsc. Jego wersja gry z myśleniem ma wyspę, domy i latarnię morską. Żadna z tych rzeczy nie działa na tyle, żeby ją pokazać: mapa ucieka za krawędź, a po wyspie nie da się jeździć.

Kosztuje pięciokrotnie więcej czasu niż mniejsza Gemma. Na dokumentach jako jedyny trzymał werdykt negatywny w obu trybach i sam zaproponował rozwiązanie zamiast poprzestać na wyliczeniu wad.

lokalny · 512 ekspertów
Qwen3-Coder-Next

Osiemdziesiąt miliardów parametrów i brak jakiegokolwiek sterowania myśleniem — ten model po prostu pisze. Napisał najwięcej kodu ze wszystkich i najszybciej ze wszystkich dużych, a efekt na ekranie jest zerowy: ekran startowy gry ma przycisk, który nic nie robi.

Mimo nazwy wypadł w tym teście najsłabiej ze wszystkich kandydatów do pisania kodu, który ma coś narysować.

lokalny · z ekspertami
Ornith 1.5-35B-A3B

Najrówniejszy wykonawca baterii. Jedyny, który odczytał tabelę ze zrzutu bezbłędnie w obu trybach, i jedyny, który w trybie myślenia dowiózł przy standardowym budżecie i pułapkę, i format JSON. Gadatliwy — oddaje dwa razy dłuższe odpowiedzi niż Gemma.

Jedyny bez gotowej wersji skwantyzowanej. Po kwantyzacji wykonanej na miejscu jest o jedną trzecią szybszy przy identycznych wynikach. Jego wersja gry z przeglądu odtworzyła okno warsztatu co do nazwy ulepszeń, ale scena wokół jest pusta i ciemna.

model zewnętrzny · agent
gpt-6-astra

Pracował normalnym trybem: czyta polecenie z pliku, pisze kod u siebie, uruchamia go, ogląda i poprawia. Zbudował jedyną grę z prawdziwym światem i jedyną wersję strony z kompletem etapów i przełącznikiem widoków.

Jazda w jego grze jest szarpana, a mapa na stronie nie pojawia się w kadrze — w tym jednym miejscu kontrola wzrokowa mu nie zadziałała, bo narzędzie do analizy obrazu odmówiło dostępu.

model zewnętrzny
Claude / Opus

Wersja wzorcowa strony powstała w tym modelu i jest jedynym wynikiem w całym zestawieniu, który działa tak, jak opisuje polecenie. Gra wyszła słabo i nie broni się przy niczyjej wersji.

model zewnętrzny
Claude / Fable

Dołączył tylko do zadania z grą. Najdokładniej odtworzył szczegóły polecenia i najlepiej trafił w sposób prowadzenia pojazdu. Za mocno obciążył pierwszą klatkę cieniami, przez co na słabszym sprzęcie strona się zacina.

Wnioski.

Pięć rzeczy, które ten test ustalił.

Modele lokalne czytają dobrze i rysują źle

Na czterdziestu przebiegach przeglądu rozkład jest jednoznaczny. Wszystkie modele poza jednym przebiegiem oddały użyteczną ocenę dokumentów w czasie od minuty do kilkunastu minut, a część z nich podniosła zarzuty, których nie postawił żaden człowiek czytający ten materiał. Na trzech zadaniach graficznych żaden z dwunastu lokalnych przebiegów nie dał wyniku nadającego się do pokazania. To nie jest kwestia rozmiaru: osiemdziesięciomiliardowy Qwen3-Coder-Next wypadł na stronie tak samo źle jak dwudziestosześciomiliardowa Gemma, tylko napisał przy tym trzy razy więcej kodu.

Więcej myślenia nie znaczy lepiej

Przy Qwenie 3.8 zależność jest odwrotna: poziom low działa, medium zapętla się, xhigh nie oddaje nic. To samo widać na tekście — wyłączenie myślenia dawało ostrzejsze werdykty niż włączenie. Przy pozostałych modelach związek między trybem a jakością okazał się przypadkowy: na stronie lepsza bywała wersja bez myślenia, na grze z myśleniem, i odwrotnie.

Budżet odpowiedzi trzeba dobrać do trybu, nie do zadania

Rozumowanie zjada ten sam limit co odpowiedź, więc model z włączonym myśleniem na limicie dobranym do trybu bez myślenia po prostu milknie. Przy pięciokrotnie większym budżecie prawie wszystkie porażki trybu myślenia zniknęły. Każda konfiguracja, która włącza myślenie, musi jednocześnie podnieść limit — inaczej puste odpowiedzi zostaną wzięte za awarię modelu.

Decyduje możliwość obejrzenia własnej pracy

Najważniejszy wynik nie dotyczy żadnego modelu z osobna. Dominujący błąd na zadaniach graficznych nie jest błędem w kodzie — kod jest poprawny, konsola milczy, a rysunek powstaje poza widocznym obszarem. Tego rodzaju pomyłki nie da się znaleźć przez czytanie kodu; trzeba zobaczyć wynik. Modele lokalne pracowały w jednym podejściu, bez możliwości sprawdzenia siebie, i wszystkie na tym poległy. Wykonawca, który sprawdza swoją pracę w przeglądarce, na trzech zadaniach z czterech wypadł wyraźnie lepiej — a tam, gdzie tej kontroli zabrakło, wpadł w dokładnie tę samą pułapkę.

Żaden wykonawca nie dostarczył wszystkiego naraz

Przy zadaniu z grą najlepszy świat zbudował jeden wykonawca, a najlepszą jazdę i najwierniejsze odtworzenie polecenia — inny. To samo w baterii: Gemma czyta tekst najszybciej, Ornith czyta obrazki najwierniej, Qwen jest najbardziej zrównoważony. Praktyczny wniosek nie brzmi „wybierz zwycięzcę”, tylko: tę samą sprawę warto puścić przez kilka modeli i zobaczyć, gdzie się rozjeżdżają.

Do czego te modele się nadają

Linki do wyników.

Każdy plik dokładnie taki, jaki oddał wykonawca. Nikt po nikim nie poprawiał ani jednej linii.

Modele zewnętrzne

wykonawcagramapa 2Dscena 3D
gpt-6-astra, agentotwórzotwórzotwórz
Claude / Opus (wzorzec)otwórzotwórzotwórz
Claude / Fableotwórznie robionenie robione

Qwen 3.6-35B-A3B

trybgramapa 2Dscena 3Dludzik
bez myśleniaotwórzotwórzotwórzotwórz
z myśleniemotwórzotwórzotwórzotwórz

Qwen 3.8-27B

trybgramapa 2Dscena 3D
bez myśleniaotwórzotwórzotwórz
poziom lowotwórzotwórzotwórz
poziom mediumbrak wynikuzero kodu po 3 h 24 minotwórz
poziom xhighbrak wynikuzero kodu po 4 hzero kodu po 4 h

Gemma 4 26B-A4B

trybgramapa 2Dscena 3Dludzik
bez myśleniaotwórzotwórzotwórzotwórz
z myśleniemotwórzotwórzotwórzotwórz

Gemma 4 31B

trybgramapa 2Dscena 3D
bez myśleniaotwórzotwórzotwórz
z myśleniemotwórzotwórzotwórz

Qwen3-Coder-Next 80B

trybgramapa 2Dscena 3D
jedyny trybotwórzotwórzotwórz

Ornith

wersja i trybgramapa 2Dscena 3Dludzik
1.0 bez myśleniaotwórzotwórzotwórz
1.0 z myśleniemotwórzotwórzotwórz
1.5 bez myśleniaotwórz
1.5 z myśleniemotwórz
1.5 FP8 bez myśleniaotwórzotwórzotwórzotwórz
1.5 FP8 z myśleniemprzerwanyotwórzotwórzotwórz

Ornith 1.0 przeszedł przegląd, Ornith 1.5 FP8 dostał te same trzy zadania później i jest w tabelach osobno. Spis wszystkich ośmiu podejść do ludzika na mapie: chlopek.

Słowniczek.

Pojęcia użyte na tej stronie, wyjaśnione raz.

model językowyProgram, który dostaje tekst i dopisuje do niego ciąg dalszy, wyliczając każde kolejne słowo. Dwa zapytania o to samo dają dwie różne odpowiedzi.
myślenie modeluTryb, w którym model przed odpowiedzią pisze dla siebie rozumowanie, niewidoczne dla użytkownika, ale zużywające czas i przyznany budżet.
poziom wysiłkuDodatkowe ustawienie w niektórych modelach, mówiące, jak długo mają myśleć. W Qwenie 3.8 przyjmuje wartości low, medium i xhigh, a domyślną jest xhigh.
model z ekspertamiKonstrukcja, w której model ma dużo parametrów, ale przy każdym słowie używa tylko ich ułamka. Waży jak duży, liczy jak mały.
model gęstyKonstrukcja, w której przy każdym słowie pracują wszystkie parametry. Wolniejszy od modelu z ekspertami o podobnym rozmiarze.
kwantyzacja FP8Zapisanie modelu mniejszą liczbą bitów na wartość — z dwóch bajtów na jeden. Mniej miejsca i szybsze liczenie kosztem drobnej utraty dokładności.
warstwa stanowaInny sposób budowy warstwy modelu niż klasyczna uwaga: zamiast porównywać każde słowo z każdym, przesuwa przez tekst wewnętrzny stan. Tańsza przy długich materiałach, ale kwantyzuje się inaczej.
okno kontekstuIle tekstu model jest w stanie mieć przed oczami naraz — polecenie i własną odpowiedź łącznie.
budżet odpowiedziGórny limit długości tego, co model napisze w jednym podejściu. Po jego wyczerpaniu odpowiedź urywa się w pół zdania, a przy włączonym myśleniu może się skończyć, zanim model zacznie odpowiadać.
pamięć kontekstuMiejsce, w którym serwer trzyma przetworzoną już część rozmowy, żeby nie liczyć jej od nowa. Jej wielkość decyduje, ile długich sesji naraz obsłuży maszyna.
szablon rozmowyPlik dołączony do modelu, określający, jak układa się przekazywane mu polecenie i jakie przełączniki model rozumie. Jedyne wiarygodne źródło informacji o tym, czy model potrafi myśleć na głos.
grafika wektorowaRysowanie obrazka poleceniami „linia stąd dotąd”, zamiast zapisywania go jako zdjęcia. Skaluje się bez utraty ostrości.
konsola przeglądarkiMiejsce, w którym przeglądarka wypisuje błędy strony. Użytkownik jej nie widzi i dostaje tylko skutek — pusty ekran albo brakujący element.
pętla rysowaniaKod wykonywany kilkadziesiąt razy na sekundę, który przerysowuje ruchomy obraz. Jeden błąd w tej pętli zatrzymuje całą scenę.
mapa cieniPomocniczy obraz, z którego przeglądarka odczytuje, co rzuca cień na co. Im większy, tym ładniejsze cienie i tym wolniejsze rysowanie.
wywoływanie narzędziZdolność modelu do samodzielnego wybrania narzędzia, wywołania go z właściwymi argumentami, odczytania wyniku i wykonania na tej podstawie kolejnego kroku.

O pomiarach

Wszystkie czasy są zmierzone, żaden nie jest szacunkiem. Każdy pochodzi z jednego podejścia — przebiegów nie powtarzaliśmy, więc żadna liczba nie jest średnią. Surowe odpowiedzi modeli, łącznie z zapisem rozumowania, są zachowane.

CRODU · crodu.com · hello@crodu.com