Zakres testu.
Co sprawdzaliśmy, na czym i czego z tych liczb nie wolno wyczytać.
Pytanie było jedno: czy model językowy uruchomiony na własnym komputerze wykona pracę, którą dziś wykonują modele dostępne przez sieć. Pytanie ma sens wtedy, gdy sprzęt już stoi — wówczas każde wywołanie modelu zewnętrznego jest kosztem, a modelu lokalnego nie.
Żeby porównanie było uczciwe, wszyscy wykonawcy dostali dokładnie to samo. Treść polecenia była tym samym plikiem, przeniesionym między maszynami i sprawdzonym sumą kontrolną. Nikt nie widział, co zrobili inni. Nikt nie dostał wskazówki po drodze. Każdy miał jedno podejście, a to, co oddał, trafiło na serwer bez jednej poprawionej linii.
Wynik w trzech zdaniach
Modele lokalne czytają dobrze i rysują źle. Na ocenie długiego tekstu i na pracy z dokumentami są szybkie i wystarczająco dokładne. Na dwunastu podejściach do zadań graficznych żadne nie dało wyniku, który dałoby się pokazać komuś z zewnątrz.
O wyniku decyduje nie rozmiar modelu, tylko to, czy wykonawca widzi, co zbudował. Dominujący błąd nie jest błędem w kodzie — kod jest poprawny, konsola milczy, a rysunek powstaje poza kadrem. Czytaniem kodu się tego nie znajdzie.
Więcej myślenia nie znaczy lepiej. Wyłączenie myślenia dawało ostrzejsze oceny tekstu niż włączenie, a jeden z modeli przy domyślnym poziomie wysiłku po czterech godzinach oddał zero znaków odpowiedzi.
Dwie części
Przegląd — cztery zadania rozdane wszystkim dziewięciu wykonawcom: ocena dokumentów, strona z mapą, scena trójwymiarowa i gra przeglądarkowa. Każdy dostał wszystkie cztery, w każdym trybie, jaki jego model obsługuje.
Bateria — zestaw zadań biurowych puszczony przez trzy modele z ekspertami, które z przeglądu wyszły najlepiej: pięć zadań tekstowych, trzy na obrazach, test wywoływania narzędzi, test wytrzymałości, prosta gra i porównanie modelu przed kwantyzacją i po niej.
Bateria jest konsekwencją przeglądu: z dziewięciu wykonawców do dalszego sprawdzania kwalifikowały się tylko modele z ekspertami, więc zamiast powtarzać całość, sprawdziliśmy tę trójkę głębiej i na pracy bliższej temu, do czego takie modele realnie się nadają.
Czego z tych liczb nie wolno wyczytać
Każdy wynik pochodzi z jednego podejścia. Żadna liczba nie jest średnią, więc różnica rzędu kilku procent nie jest różnicą. Ten sam model zapytany dwa razy o to samo odpowie za każdym razem inaczej — to cecha konstrukcji, nie usterka. Test nie sprawdzał też trybu, w którym takie modele pracują na co dzień: rozmowy w kilku turach, z poprawkami.
Metoda.
Stanowisko, zadania i sposób pomiaru.
Program, który dostaje tekst i dopisuje do niego ciąg dalszy. Nie wyszukuje gotowych odpowiedzi w bazie — wylicza każde kolejne słowo. Dlatego wynik pojedynczego podejścia nigdy nie jest dowodem na to, co model umie w ogóle.
Stanowisko
Modele lokalne chodziły na komputerze z układem graficznym NVIDIA GB10 i stu dwudziestoma ośmioma gigabajtami pamięci dzielonej między procesor a układ graficzny. Oprogramowanie serwujące: vLLM w obrazie przypiętym do konkretnej wersji, ten sam dla wszystkich modeli, żeby różnica w wyniku nie brała się z różnicy w środowisku.
Przy przeglądzie maszyna obsługiwała jeden duży model naraz; każda zmiana oznaczała wyładowanie modelu i wczytanie następnego, co samo w sobie zajmuje od czterech do jedenastu minut. Przy baterii okazało się, że dwa modele stoją obok siebie na jednej takiej maszynie bez problemu, pod jednym warunkiem — muszą wczytywać się po kolei, a nie równolegle. Puszczone równolegle ścigają się o pamięć i drugi pada na braku miejsca na pamięć kontekstu.
Cztery zadania przeglądu
- Ocena dokumentów. Trzy dokumenty handlowe, razem pięćdziesiąt pięć tysięcy znaków. Polecenie: streścić każdy z osobna, a potem ocenić bez taryfy ulgowej, czy spełnia swoje zadanie, z dosłownymi cytatami i jednoznacznym werdyktem — nadaje się, nadaje się po poprawkach, nie nadaje się.
- Strona z mapą. Jeden plik, ponad tysiąc linii, w środku mapa miasta rysowana grafiką wektorową: jedenaście wyróżnionych punktów w podanych współrzędnych, węzeł centralny połączony z nimi liniami, zabudowa tła, siatka ulic, rzeka, dymki z podpisami. Do tego cała treść strony produktowej. Siedemnaście tysięcy znaków polecenia.
- Scena trójwymiarowa. Ta sama treść strony, ale zamiast mapy wyspa unosząca się w przestrzeni, rysowana w przeglądarce. Zadanie trudniejsze o jeden wymiar: trzeba ustawić kamerę, światło i skalę tak, żeby widz w ogóle zobaczył to, co model zbudował.
- Gra. Kolejka linowa nad morzem chmur, dwie stacje, tor z zakrętami i mostami, sterowanie klawiszami, licznik prędkości i pasażerów, system komfortu jazdy, druga scena z warsztatem. Wszystko w jednym pliku. Trzy tysiące trzysta znaków polecenia.
Bateria
Bateria sprawdza nie to, czy model zbuduje stronę, tylko czy nadaje się do pracy biurowej: czytania długich materiałów, wyciągania z nich ustaleń, trzymania narzuconego formatu, odczytu zrzutów ekranu i wywoływania narzędzi. Pełny opis zadań w zakładce Bateria.
Co mierzyliśmy
Czas od wysłania polecenia do ostatniego znaku odpowiedzi. Długość odpowiedzi i osobno długość samego rozumowania. Powód zakończenia — czy model skończył, bo powiedział wszystko, czy dlatego, że wyczerpał przyznany budżet. Przy zadaniach graficznych dodatkowo: czy strona otwiera się bez błędu w konsoli przeglądarki, czy widać to, co miało być widać, i czy da się tym sterować.
Miejsce, w którym przeglądarka wypisuje błędy strony. Zwykły użytkownik jej nie otwiera i widzi tylko skutek: pusty ekran albo brakujący element. To jedyny sposób odróżnienia strony, która się psuje, od strony, która działa, tylko wygląda źle.
Czego nie mierzyliśmy
Zużycia prądu ani obciążenia maszyny. Przebiegów nie powtarzaliśmy. Grywalności nie oceniała zdalna przeglądarka wciskająca syntetyczne klawisze — ta metoda cztery razy z rzędu dała werdykt niezgodny z tym, co widać na ekranie. Z automatu raportujemy wyłącznie błędy konsoli i to, co widać na zrzucie; o tym, czy grą da się grać, rozstrzyga człowiek, otwierając ją u siebie.
Uczestnicy.
Sześć modeli na własnym sprzęcie, trzech wykonawców na modelach dostępnych przez sieć.
Modele lokalne
| model | rozmiar | sterowanie myśleniem |
|---|---|---|
| Qwen 3.6-35B-A3B | 35 mld, z ekspertami | włącz / wyłącz |
| Qwen 3.8-27B | 27 mld, gęsty | włącz / wyłącz oraz trzy poziomy wysiłku |
| Gemma 4 26B-A4B | 26 mld, z ekspertami | włącz / wyłącz |
| Gemma 4 31B | 31 mld, gęsty | włącz / wyłącz |
| Qwen3-Coder-Next | 80 mld, 512 ekspertów | brak — model nie ma takiej możliwości |
| Ornith 1.0-35B | 35 mld, z ekspertami | włącz / wyłącz |
| Ornith 1.5-35B-A3B | 35 mld, z ekspertami | włącz / wyłącz |
| Ornith 1.5-35B-A3B FP8 | ten sam model skwantyzowany na miejscu | włącz / wyłącz |
Konstrukcja, w której model ma bardzo dużo parametrów, ale przy każdym słowie używa tylko małej ich części. Waży jak duży, liczy jak mały. W tabeli to pozycje z dwiema liczbami w nazwie — pierwsza mówi, ile waży, druga, ile realnie pracuje przy każdym słowie.
Tryb, w którym model przed właściwą odpowiedzią pisze dla siebie rozumowanie — użytkownik go nie widzi, ale model zużywa na nie czas i przyznany budżet. Bywa, że pomaga; bywa też, że model zapętla się w rozważaniach i wyczerpuje cały budżet, nie napisawszy ani słowa odpowiedzi.
Sterowania myśleniem nie da się odgadnąć
Ani z nazwy modelu, ani z dokumentacji producenta. Trzeba zajrzeć do szablonu rozmowy, który każdy model niesie ze sobą, i sprawdzić, jakie przełączniki są w nim obsłużone. Przy Qwenie 3.8 kosztowało to cztery godziny: model ma trzy poziomy wysiłku, domyślnym jest najwyższy, a pierwsze podejście do strony z mapą wyprodukowało dwieście czterdzieści sześć tysięcy znaków rozumowania i ani jednej linii kodu.
Wykonawcy na modelach zewnętrznych
| wykonawca | tryb pracy | zadania |
|---|---|---|
| gpt-6-astra, agent z pętlą kontroli | czyta polecenie z pliku, pisze kod u siebie, uruchamia go w przeglądarce, ogląda wynik i poprawia | strona z mapą, scena 3D, gra |
| Claude / Opus | wersja wzorcowa strony, działająca na produkcji | strona z mapą, scena 3D, gra |
| Claude / Fable | model nastawiony na dłuższe, samodzielne pisanie kodu | gra |
Modele lokalne pisały w ciemno — jedno podejście, bez możliwości obejrzenia własnego wyniku. Agent na modelu zewnętrznym widział, co zbudował, i miał prawo poprawić. Różnica w wynikach pokazuje, ile w tej pracy waży sam model, a ile możliwość sprawdzenia siebie.
Zadanie: ocena dokumentów.
Pięćdziesiąt pięć tysięcy znaków do przeczytania, streszczenia i oceny z werdyktem.
Materiałem były trzy dokumenty handlowe. Polecenie mówiło wprost, że ocena ma być szorstka, bez uprzejmości i bez podsumowań w rodzaju „ogólnie dobry dokument”, z dosłownymi cytatami i jednym z trzech werdyktów. Zadanie sprawdza czytanie ze zrozumieniem, zdolność do znalezienia sprzeczności wewnątrz długiego materiału i gotowość do wystawienia oceny negatywnej.
| model i tryb | czas | odpowiedź | cytaty | werdykt |
|---|---|---|---|---|
| Qwen 3.6 bez myślenia | 67 s | 9 185 zn | 27 | nie nadaje się |
| Qwen 3.6 z myśleniem | 134 s | 4 881 zn | 11 | po poprawkach |
| Qwen 3.8 bez myślenia | 8 min 42 s | 12 453 zn | 74 | nie nadaje się |
| Qwen 3.8 poziom low | 14 min 18 s | 12 138 zn | 84 | nie nadaje się |
| Qwen 3.8 poziom medium | 16 min 30 s | 15 951 zn | 83 | po poprawkach |
| Qwen 3.8 poziom xhigh | 35 min | 0 zn | — | brak odpowiedzi |
| Gemma 4 26B bez myślenia | 58 s | 5 117 zn | 30 | nie nadaje się |
| Gemma 4 26B z myśleniem | 1 min 33 s | 4 132 zn | 21 | po poprawkach |
| Gemma 4 31B bez myślenia | 4 min 23 s | 4 837 zn | 22 | nie nadaje się |
| Gemma 4 31B z myśleniem | 7 min 40 s | 5 303 zn | 28 | nie nadaje się |
| Qwen3-Coder-Next | 1 min 18 s | 9 608 zn | — | — |
| Ornith 1.0 bez myślenia | 1 min 41 s | 8 382 zn | — | — |
| Ornith 1.0 z myśleniem | 3 min 6 s | 17 771 zn | — | — |
Jedyny przebieg bez odpowiedzi
Qwen 3.8 na najwyższym poziomie wysiłku po trzydziestu pięciu minutach wyczerpał budżet na samym rozumowaniu — pięćdziesiąt trzy tysiące znaków rozważań i zero znaków odpowiedzi. Ten sam wzorzec zabił wcześniej jego podejście do strony z mapą.
Wyłączone myślenie dawało ostrzejsze oceny
Trzy modele — oba Qweny i Gemma 4 26B — bez myślenia wystawiły ocenianemu dokumentowi werdykt „nie nadaje się”, a z myśleniem złagodziły go do „nadaje się po poprawkach”. Wyjątkiem jest Gemma 4 31B, która w obu trybach została przy werdykcie negatywnym. Rozumowanie na tekście służy modelowi głównie do szukania okoliczności łagodzących.
Co dało się z tego wyciągnąć
Wartością tego zadania nie jest tabela, tylko treść zarzutów. Modele wyłapały wewnętrzne sprzeczności między okładką a stopką tego samego dokumentu, twierdzenia niepoparte materiałem dowodowym w tym samym pliku, kluczowe pojęcie użyte kilkadziesiąt razy i nigdzie nie zdefiniowane, oraz sekcję zakazów bez odpowiadającej jej sekcji dopuszczalnych odpowiedzi. Kilka z tych zarzutów nie padło wcześniej z ust żadnego człowieka, który ten materiał czytał. Na tym zadaniu model lokalny jest realnie użyteczny.
Zadanie: strona z mapą i scena 3D.
Dwanaście podejść modeli lokalnych do zadania, o którym wiadomo, że jest wykonalne.
Zadanie było uczciwe w tym sensie, że wzorzec istnieje: strona z tej samej treści polecenia została wcześniej zbudowana przez model zewnętrzny i działa na produkcji. Wiadomo więc, że polecenie jest wykonalne i że da się z niego zbudować to, co opisuje.
Sposób rysowania obrazków w przeglądarce poleceniami „narysuj linię stąd dotąd”, „narysuj prostokąt tej wielkości”. Obrazek nie jest zdjęciem, tylko zestawem instrukcji. Przewaga: skaluje się bez utraty ostrości. Trudność: jeśli model pomyli skalę albo układ współrzędnych, rysunek powstaje poprawnie, tylko poza widocznym obszarem — i widz ma pusty ekran przy zupełnie zdrowym kodzie.
| model i tryb | wersja z mapą | scena 3D |
|---|---|---|
| Qwen 3.6 z myśleniem | rysuje pas mapy, brak zabudowy, dymki odklejone od punktów | kopuła klocków zamiast wyspy, etykiety w stosie |
| Qwen 3.6 bez myślenia | wywraca się przy pierwszej etykiecie | kamera wewnątrz zabudowy |
| Qwen 3.8 bez myślenia | wywraca się przy trzecim obiekcie | pionowy stożek z kulką |
| Qwen 3.8 poziom low | działa, konsola czysta, zabudowa uboga | wyspa z zabudową i rzeką, kamera za blisko |
| Qwen 3.8 poziom medium | brak wyniku po 3 h 24 min | wyspa z rzeką, ani jednego budynku |
| Qwen 3.8 poziom xhigh | brak wyniku po 4 h | brak wyniku |
| Gemma 4 26B bez myślenia | pusta płaszczyzna, kilka punktów | pusty obszar pod tekstem |
| Gemma 4 26B z myśleniem | najlepszy nagłówek strony w stawce, mapa pusta, etykiety ucięte za krawędzią | pusty obszar, układ nawigacji odbity |
| Gemma 4 31B bez myślenia | rzeka, ulice, zabudowa i dziesięć etykiet, mapa ucieka za prawą krawędź | zabudowa obecna, całość przechylona |
| Gemma 4 31B z myśleniem | miasto, dymki z podpisami, licznik dolicza do jedenastu, całość mała i tonie w szarości | zabudowa obecna, skala rozjechana |
| Qwen3-Coder-Next | najdłuższy kod całego testu, wynik nieczytelny | nieczytelny |
| Ornith 1.0, oba tryby | nieczytelny | nieczytelny |
| Ornith 1.5 bez myślenia | kompletny plik w 11 min | zapętlenie: osiem razy zaczyna plik od nowa |
| Ornith 1.5 z myśleniem | kompletny plik | kompletny plik, skończył sam |
| gpt-6-astra, agent | pełna treść, przełącznik widoków, etapy przy przewijaniu; mapa nie pojawia się w kadrze | jeden dokument z obiema wersjami |
| Claude / Opus (wzorzec) | działa | działa |
Dwanaście podejść modeli lokalnych, z czego dwa doszły do czegoś, co przypomina mapę miasta, a dziesięć nie. Żadne nie nadaje się do pokazania. Przy patrzeniu wyłącznie na siebie nawzajem łatwo uznać najmniej złe podejście za dobre — miarą jest strona, która działa, nie reszta stawki.
Jeden błąd powtarza się u wszystkich
Niezależnie od modelu, rozmiaru i trybu myślenia wzorzec porażki jest ten sam: treść i układ powstają poprawnie, a rysunek powstaje poza kadrem. Zabudowa jest w kodzie, tylko w skali stukrotnie za małej. Etykiety są, tylko za lewą krawędzią. Kamera jest ustawiona, tylko wewnątrz bryły albo pod nią. Konsola w większości przypadków milczy, bo z punktu widzenia przeglądarki nic złego się nie dzieje. Model sprawdza kod przez czytanie kodu, a kod jest poprawny.
Agent, który widzi swój wynik
Wykonawca na gpt-6-astra oddał obie wersje strony z pełną treścią, przełącznikiem między widokami, etapami pojawiającymi się przy przewijaniu i kartami tematycznymi zmieniającymi się przy każdym etapie. Sprawdzał swoją pracę w przeglądarce i poprawiał to, co znalazł.
Na jednym elemencie ta kontrola nie zadziałała — narzędzie do analizy obrazu odmówiło mu dostępu, więc układ sprawdzał przez odczytanie struktury dokumentu zamiast przez patrzenie. I dokładnie tam wynik jest taki sam jak u modeli lokalnych: mapa nie pojawia się w kadrze, a licznik obiektów stoi na zerze. Granica przebiega nie między modelami, tylko między widzeniem wyniku a czytaniem kodu.
Zadanie: gra przeglądarkowa.
Najostrzejsze z zadań, bo wynik albo da się uruchomić i przejechać, albo nie.
Gra sprawdza coś, czego trzy poprzednie zadania nie sprawdzają. Dokument można ocenić po przeczytaniu, stronę po obejrzeniu, ale grę trzeba uruchomić i pojechać. Jeśli pociąg nie rusza, nie ma znaczenia, jak wygląda stacja.
| wykonawca | co powstało |
|---|---|
| gpt-6-astra, agent | wyspa, drzewa, most, szyld stacji, ludzie na peronie, panel sterowania, karta wprowadzająca. Najlepsza grafika całego testu; jazda szarpana |
| Claude / Fable | tramwaj na szynach, peron z markizą i kolejką ludzi, wyspy w tle, most wygięty w dal, pełne przyrządy. Najlepsza grywalność i najwierniejsze odtworzenie polecenia |
| Claude / Opus | scena warsztatu, tor, system komfortu; całość słaba |
| Gemma 4 26B bez myślenia | jedzie, grafika uboga — jedyna lokalna, którą da się przejechać |
| Gemma 4 26B z myśleniem | komplet przyrządów i napisów, warsztat z przyciskami ulepszeń, świata nie widać |
| Gemma 4 31B bez myślenia | wywraca się na starcie: zadeklarowana zmienna o nazwie zarezerwowanej przez przeglądarkę |
| Gemma 4 31B z myśleniem | wyspa, domy, latarnia morska, przyrządy działają; jazdy nie ma |
| Qwen 3.6, oba tryby | wyjątek w pętli rysowania — tor jest pustą krzywą |
| Qwen 3.8 bez myślenia | ładna karta startowa i koniec: użyte polecenie nie istnieje w bibliotece, którą sam wczytał |
| Qwen 3.8 poziom low | przyrządy się rysują, scena nie |
| Qwen 3.8, poziomy medium i xhigh | nic nie oddały |
| Qwen3-Coder-Next | ekran startowy z przyciskiem, który nic nie robi |
| Ornith 1.0 bez myślenia | kamera wewnątrz bryły terenu |
| Ornith 1.0 z myśleniem | okno warsztatu z czterema ulepszeniami z polecenia, scena ciemna i pusta |
| Ornith 1.5 bez myślenia | kompletny plik w 10 minut |
| Ornith 1.5 z myśleniem | przebieg przerwany przed oddaniem wyniku |
Dwa wyniki warte uwagi
Agent zbudował jedyny świat, po którym widać, że ktoś czytał opis miasteczka: wyspa ma kształt, peron ma szyld z nazwą stacji, na peronie stoją ludzie, a most prowadzi gdzieś dalej. Jazda jest jednak szarpana — pociąg skacze zamiast płynąć po torze, czyli ta część zadania, która mówiła o wrażeniu jazdy, wypadła najsłabiej.
Fable zrobił odwrotnie: najlepiej odtworzył drobiazgi polecenia — liczbę pasażerów, pasek komfortu, warunki na trasie, przyciski mocy i hamulca, przycisk warsztatu — i najlepiej trafił w to, jak taka gra ma się prowadzić. Obciążył za to pierwszą klatkę cieniami: dwie mapy cieni 2048 × 2048 z miękkim filtrowaniem, dziewięćset instancji chmur oraz szyny, podkłady i słupy, wszystko rzucające cień. Na maszynie z mocnym układem graficznym jest grywalne, na słabszej się zacina.
Najlepszy możliwy wynik to grafika i świat od pierwszego wykonawcy połączone z silnikiem jazdy i dbałością o szczegóły od drugiego. Żaden pojedynczy przebieg tego nie osiągnął.
Dlaczego gry wywracają się częściej niż strony
Strona, która rysuje się źle, nadal się wyświetla. Gra, która rysuje się źle, przestaje być grą. Dochodzi do tego pętla — kod wykonywany sześćdziesiąt razy na sekundę. Jeden błąd w tej pętli zatrzymuje wszystko, i właśnie tam wywróciły się oba przebiegi Qwena 3.6: tor został zbudowany jako pusta krzywa, a pętla przy pierwszym obrocie pyta tę krzywą o punkt, którego nie ma.
Drugi powtarzalny błąd to sięganie po polecenia, których w użytej bibliotece nie ma. Model pamięta nazwę z innej wersji, wpisuje ją, i strona umiera przy starcie. Qwen 3.8 bez myślenia i Gemma 4 31B bez myślenia poległy na tym, każdy na innym poleceniu.
Prostsze zadanie
Trzy modele z baterii dostały zadanie celowo najprostsze z możliwych — ładna mapa, po której chodzi ludzik, żadnych przeciwników, punktów ani poziomów. Chodziło o sprawdzenie, czy porażki na kolejce brały się z modelu, czy ze złożoności zadania. Wyniki otwierają się i renderują, ale żaden nie jest tym, co opisywało polecenie: grafika i sterowanie pozostają słabym punktem wszystkich trzech. Czasy w zakładce Bateria.
Bateria modeli z ekspertami.
Praca biurowa zamiast budowania stron.
Po przeglądzie było jasne, że do dalszego sprawdzania wchodzą wyłącznie modele z ekspertami: gęste kosztują pięciokrotnie więcej czasu przy tej samej albo gorszej jakości. Zostały trzy — Qwen 3.6-35B-A3B, Gemma 4 26B-A4B i Ornith 1.5-35B-A3B — i te trzy przeszły baterię zbudowaną z materiałów roboczych: automatycznego transkryptu spotkania, zgłoszenia usterki technicznej, dokumentów handlowych i zrzutów ekranu z przeglądu.
Pięć zadań tekstowych
| kod | zadanie | materiał | budżet | co sprawdza |
|---|---|---|---|---|
| z1 | Wypisz wszystkie ustalenia ze spotkania: co · kto odpowiada · termin | transkrypt automatyczny, bez korekty, 26 506 zn | 8 000 tok | wyciąganie faktów z surowego zapisu z przekręconymi nazwiskami |
| z2 | Pięć pytań, w tym dwa, na które w materiale nie ma odpowiedzi | ten sam transkrypt | 2 000 tok | czy model przyzna „brak w materiale”, czy zmyśli prawdopodobnie brzmiącą odpowiedź |
| z3 | Zamień zgłoszenie na JSON o dokładnie dziesięciu polach | zgłoszenie usterki technicznej, 8 657 zn | 2 000 tok | trzymanie narzuconego formatu co do pola, bez otoczki i bez komentarza |
| z4 | Napisz odpowiedź do zgłaszającego, po ludzku, maksymalnie pięć zdań | to samo zgłoszenie | 1 500 tok | tłumaczenie treści technicznej na nietechniczną i trzymanie limitu długości |
| z5 | Streść i oceń bez taryfy ulgowej trzy dokumenty handlowe | 55 156 zn | 16 000 tok | to samo co jedno z zadań przeglądu, dla porównywalności |
Wyniki — budżet standardowy
| model / tryb | z1 ustalenia | z2 pułapka | z3 format | z4 pismo | z5 ocena |
|---|---|---|---|---|---|
| Qwen 3.6 · bez | 16 s · 1 488 zn | 5/5 · 2 s | zgodny · 8 s | 3 s · 418 zn | 84 s · 10 762 zn |
| Qwen 3.6 · myśli | 103 s · 1 754 zn | 0/5 · budżet | brak · budżet | brak · budżet | 157 s · 7 237 zn |
| Gemma 4 26B · bez | 15 s · 737 zn | 5/5 · 7 s | zgodny · 9 s | 3 s · 364 zn | 54 s · 5 046 zn |
| Gemma 4 26B · myśli | 154 s · 713 zn | 5/5 · 44 s | brak · budżet | brak · budżet | 103 s · 4 916 zn |
| Ornith 1.5 · bez | 33 s · 2 333 zn | 5/5 · 4 s | zgodny · 13 s | 8 s · 667 zn | 131 s · 11 453 zn |
| Ornith 1.5 · myśli | brak · budżet | 5/5 · 60 s | zgodny · 61 s | brak · budżet | 570 s · 7 245 zn |
| Ornith 1.5 FP8 · bez | 43 s · 4 338 zn | 5/5 · 3 s | zgodny · 10 s | 6 s · 688 zn | 95 s · 10 525 zn |
| Ornith 1.5 FP8 · myśli | brak · budżet | 0/5 · budżet | brak · budżet | brak · budżet | 456 s · 9 241 zn |
„budżet” znaczy, że model zużył cały przyznany limit na samo rozumowanie i skończył, nie napisawszy odpowiedzi. To nie jest zerowy wynik merytoryczny, tylko zderzenie trybu myślenia z limitem dwóch tysięcy tokenów.
Ten sam zestaw z budżetem pięciokrotnie większym
| model (tryb myślenia) | z2 pułapka | z3 format | z4 pismo | w2 pusta strona | w3 strona wzorcowa |
|---|---|---|---|---|---|
| Qwen 3.6 | 5/5 | zgodny | napisane | trafne | trafne |
| Gemma 4 26B | 5/5 | zgodny | napisane | trafne | błędne |
| Ornith 1.5 | 5/5 | zgodny | napisane | trafne | trafne |
| Ornith 1.5 FP8 | 5/5 | zgodny | brak · budżet | trafne | trafne |
Prawie wszystkie porażki trybu myślenia z tabeli wyżej znikają, gdy modelowi da się pięciokrotnie większy limit. Budżet odpowiedzi jest ustawieniem zapytania, nie modelu, a rozumowanie konsumuje ten sam limit co odpowiedź. Konfiguracja, która włącza myślenie na limicie dobranym do trybu bez myślenia, produkuje puste odpowiedzi, które łatwo wziąć za awarię modelu.
Trzy zadania na obrazach
| kod | obraz | polecenie |
|---|---|---|
| w1 | strona dokumentu z tabelą wyników przeglądu | cztery pytania o zawartość tabeli: liczba wierszy z danymi, który wiersz ma w kolumnie odpowiedź wartość zero, wartość w konkretnej komórce, werdykt w konkretnym wierszu |
| w2 | zrzut strony, na której mapa nie narysowała się w kadrze | czy opisana mapa jest widoczna, co konkretnie widać w jej miejscu, czy stronę da się pokazać odbiorcy |
| w3 | zrzut strony wzorcowej, na której mapa jest | to samo — oczekiwana odpowiedź przeciwna |
w2 i w3 to para: model, który na wszystko odpowiada „tak, widać”, zdobywa punkt na jednym i traci na drugim. Sprawdzamy patrzenie, nie uprzejmość.
| model / tryb | w1 odczyt tabeli | w2 pusta strona | w3 strona wzorcowa |
|---|---|---|---|
| Qwen 3.6 · bez | 3/4 · 5 s | trafne · 4 s | trafne · 3 s |
| Qwen 3.6 · myśli | brak · budżet | trafne · 25 s | trafne · 20 s |
| Gemma 4 26B · bez | 1/4 · 1 s | trafne · 3 s | trafne · 2 s |
| Gemma 4 26B · myśli | brak · budżet | trafne · 22 s | błędne · budżet |
| Ornith 1.5 · bez | 4/4 · 6 s | trafne · 12 s | trafne · 5 s |
| Ornith 1.5 · myśli | 4/4 · 28 s | trafne · 29 s | błędne · 37 s |
| Ornith 1.5 FP8 · bez | 4/4 · 5 s | trafne · 8 s | trafne · 4 s |
| Ornith 1.5 FP8 · myśli | 4/4 · 15 s | trafne · 24 s | trafne · 29 s |
Odczyt tabeli ze zrzutu rozdzielił tę trójkę mocniej niż cokolwiek innego: Ornith 4/4 w każdym trybie, Qwen 3/4, Gemma 1/4. Wszystkie trzy mają wzrok, ale tylko jeden czyta nim liczby na tyle wiernie, żeby oprzeć na tym pracę z dokumentami.
Wywoływanie narzędzi
Trzy narzędzia: wypisz zadania z projektu, przeczytaj zadanie, dopisz komentarz. Model dostaje polecenie w jednym zdaniu, a odpowiedzi narzędzi są przygotowane z góry. Liczy się, czy wywoła właściwe narzędzia we właściwej kolejności, poda właściwe argumenty i zamelduje prawdę o tym, co zrobił.
| model | bez myślenia | z myśleniem | wynik |
|---|---|---|---|
| Qwen 3.6 | 5 s | 14 s | komplet, poprawnie |
| Gemma 4 26B | 5 s | 15 s | komplet, poprawnie |
| Ornith 1.5 | 11 s | 20 s | komplet, poprawnie |
| Ornith 1.5 FP8 | 9 s | 10 s | komplet, poprawnie |
Cztery na cztery, w obu trybach, w tej samej kolejności wywołań. Różnica jest w tonie meldunku: Qwen i Gemma odpowiadają jednym zdaniem, Ornith rozpisuje się na punkty i cytuje treść komentarza.
Test wytrzymałości
Sto zapytań pod rząd, mieszanych co do długości i rodzaju, co siódme z włączonym myśleniem, z automatycznym wykrywaczem uszkodzonej odpowiedzi: pusta odpowiedź, zbyt mały udział liter, powtarzające się znaczniki rozumowania, długie ciągi jednego znaku, ciągi znaków ramek.
| model | czyste | średni czas | co się zepsuło |
|---|---|---|---|
| Ornith 1.5 FP8 | 96 / 100 | 9,3 s | cztery puste odpowiedzi, wszystkie w trybie myślenia, wszystkie z wyczerpanego budżetu — ani jednego uszkodzonego tekstu |
Ten test powstał po kwantyzacji, żeby wykluczyć uszkodzenie modelu: model uszkodzony przy kwantyzacji po stu zapytaniach sypie znakami ramek i powtórkami. Tu nie wystąpił ani jeden taki przypadek.
Gra: ludzik na mapie
| model | bez myślenia | z myśleniem |
|---|---|---|
| Qwen 3.6 | 133 s · 17 423 zn | 245 s · 32 007 zn |
| Gemma 4 26B | 124 s · 11 602 zn | 168 s · 10 844 zn |
| Ornith 1.5 | 305 s · 22 108 zn | 1 256 s · 22 394 zn |
| Ornith 1.5 FP8 | 315 s · 32 332 zn | 970 s · 23 757 zn |
Ornith 1.5 na trzech zadaniach przeglądu
Ornith 1.5 FP8 dostał później te same trzy zadania graficzne co uczestnicy przeglądu — mapę, scenę trójwymiarową i grę — z identyczną treścią polecenia.
| zadanie i tryb | czas | co oddał | powód zakończenia |
|---|---|---|---|
| mapa · bez myślenia | 11 min | 46 588 zn kodu, plik domknięty | skończył sam |
| mapa · z myśleniem | 66 min | 52 948 zn kodu, plik domknięty; 222 195 zn rozumowania | wyczerpany budżet |
| scena 3D · bez myślenia | 69 min | osiem razy zaczął ten sam plik od nowa, razem 315 708 zn | wyczerpany budżet |
| scena 3D · z myśleniem | 43 min | 55 331 zn kodu, plik domknięty; 160 136 zn rozumowania | skończył sam |
| gra · bez myślenia | 10 min | 50 290 zn kodu, plik domknięty | skończył sam |
| gra · z myśleniem | — | przebieg przerwany przed oddaniem wyniku | — |
Zapętlenie zamiast wywrotki. Na scenie 3D bez myślenia model nie napisał błędnego kodu — napisał ten sam plik osiem razy. Polecenie mówiło o jednym pliku w jednym bloku. Publikujemy pierwszy blok, jedyny domknięty; pozostałe siedem to powtórki. To inny rodzaj porażki niż wszystko, co dał przegląd, gdzie kod powstawał raz i wywracał się w przeglądarce.
Tu myślenie pomagało. Na obu zadaniach graficznych wersja z myśleniem wypadła lepiej niż bez: obie domknięte, scena 3D nawet szybciej. Przegląd pokazywał zależność odwrotną. Przy tym modelu ona nie obowiązuje.
Budżet odpowiedzi w tych przebiegach wynosił 120 000 tokenów — tyle samo, co u pozostałych uczestników, dla porównywalności. Okno kontekstu modelu jest ponad dwa razy większe, więc tam, gdzie w tabeli stoi „wyczerpany budżet”, jest to sufit ustawienia zapytania, a nie granica możliwości modelu.
Kwantyzacja FP8.
Jedyny model w zestawie bez gotowej wersji skwantyzowanej — i to, czego nie ma w żadnej instrukcji.
Sposób zapisania modelu mniejszą liczbą bitów na każdą wartość — z dwóch bajtów do jednego. Model zajmuje wtedy około połowy miejsca i liczy szybciej, kosztem drobnej utraty dokładności. Wszystkie pozostałe modele w tym teście przyszły już w takiej postaci od producenta.
Po co
Ornith wypadł w baterii najlepiej z całej trójki, ale w pełnej precyzji zajmował tyle pamięci, że nie mieścił się obok drugiego modelu z sensownym oknem kontekstu. Pytanie brzmiało: czy da się go zmniejszyć o połowę bez utraty tego, za co został wybrany.
Dwie ślepe uliczki
- Gotowa wersja NVFP4 od producenta nie wczytuje się na tym stosie. Przypięty obraz vLLM nie obsługuje tego układu wag dla modeli z ekspertami i wywraca się na braku jednego klucza skali. Z przypiętej wersji nie schodzi się dla jednego modelu.
- Pierwsza własna próba dała model bez wieży wizyjnej. Standardowa klasa ładująca modele językowe zgubiła część odpowiedzialną za obraz, a konfiguracja przestała pasować sama do siebie. Naprawa: ładować klasą dla modeli tekstowo-obrazowych.
Awaria, która wyjaśniła całą resztę
Druga próba dała model kompletny, wczytujący się poprawnie — i produkujący śmieci: powtarzające się znaczniki rozumowania, niemieckie słowa w polskiej odpowiedzi, długie ciągi znaków ramek. Model, który prawie działa, jest gorszy od modelu, który nie wstaje.
Przyczynę widać dopiero w spisie warstw: trzydzieści z czterdziestu warstw tej architektury to nie klasyczna uwaga, tylko warstwy stanowe — inna konstrukcja, z własnymi macierzami i parametrami czasowymi. Kwantyzator traktował je jak zwykłe warstwy liniowe i psuł im skalę. Poprawka to rozszerzenie listy pominięć o te warstwy, o eksperta współdzielonego, o bramkę wyboru ekspertów i o całą wieżę wizyjną.
Schemat FP8_DYNAMIC na warstwach liniowych, bez danych kalibracyjnych, z pominięciem:
głowicy wyjściowej, wszystkich warstw stanowych, eksperta współdzielonego, bramki wyboru ekspertów,
całej wieży wizyjnej i warstw predykcji wielotokenowej. Czas przeliczenia: 269 sekund.
Wynik: 36 GB na dysku, przy dwukrotnie większej wersji wyjściowej.
Ile to kosztowało jakości
| sprawdzian | pełna precyzja | FP8 |
|---|---|---|
| z2 pułapka (bez / myśli) | 5/5 · 5/5 | 5/5 · budżet |
| z3 format JSON (bez myślenia) | zgodny | zgodny |
| w1 odczyt tabeli (bez / myśli) | 4/4 · 4/4 | 4/4 · 4/4 |
| w3 strona wzorcowa (z myśleniem) | błędne | trafne |
| wywoływanie narzędzi | komplet | komplet |
| sto zapytań pod rząd | nie robiony | 96/100 czystych |
Przepustowość — znaki na sekundę, ten sam sprzęt
| przebieg | pełna precyzja | FP8 | różnica |
|---|---|---|---|
| z1 ustalenia, bez myślenia | 71 zn/s | 101 zn/s | +42 % |
| z5 ocena dokumentów, bez myślenia | 87 zn/s | 111 zn/s | +27 % |
| z5 ocena dokumentów, z myśleniem | 108 zn/s | 136 zn/s | +26 % |
| gra, bez myślenia | 73 zn/s | 103 zn/s | +41 % |
| gra, z myśleniem | 83 zn/s | 108 zn/s | +30 % |
Liczone razem z rozumowaniem, bo ono też jest pracą modelu. Wcześniejsze wrażenie, że Ornith jest wolny, brało się z pomiaru czasu zamiast prędkości: on nie jest wolny, tylko gadatliwy. Przy tej samej prędkości pisania oddaje dłuższą odpowiedź.
Identyczne wyniki punktowe, o jedną odpowiedź lepiej na zadaniu wizualnym, od dwudziestu sześciu do czterdziestu dwóch procent szybciej i dwa razy więcej miejsca na pamięć kontekstu przy tym samym udziale pamięci. Przy tej architekturze cena kwantyzacji jest w praktyce zerowa — pod warunkiem pominięcia warstw stanowych.
Czasy.
Cztery modele przepuszczone przez identyczne stanowisko, od najszybszego do najwolniejszego.
Poniższe cztery modele przeszły wszystkie cztery zadania przeglądu na tym samym stanowisku, w identyczny sposób. Przy modelach z dwoma trybami podane są dwie liczby: bez myślenia i z myśleniem. Oba tryby jednego zadania liczyły się równolegle, więc czas całego przeglądu jest krótszy niż suma pozycji.
| model | dokumenty | mapa | scena 3D | gra | cały przegląd |
|---|---|---|---|---|---|
| Gemma 4 26B-A4B | 58 s / 93 s | 4 min / 6 min | 4 min / 6 min | 3 min / 4 min | 17 min |
| Qwen3-Coder-Next | 78 s | 9 min | 5 min | 4 min | 19 min |
| Ornith 1.0 35B | 101 s / 186 s | 14 min / 15 min | 13 min / 15 min | 5 min / 9 min | 42 min |
| Gemma 4 31B | 4 min / 8 min | 33 min / 32 min | 24 min / 31 min | 15 min / 19 min | 92 min |
Dwa modele z ekspertami zamknęły komplet w niecałe dwadzieścia minut. Gemma 4 31B, model gęsty o zbliżonej liczbie parametrów, potrzebowała pięć razy tyle. To różnica konstrukcji, nie jakości: model z ekspertami przy każdym słowie używa ułamka swoich parametrów.
Qweny przechodziły przez wcześniejszy, mniej jednolity zestaw pomiarów, więc ich czasów nie da się zestawić w tej samej tabeli. Rzędy wielkości: Qwen 3.6 z myśleniem zbudował mapę w trzydzieści pięć minut, Qwen 3.8 bez myślenia w pięćdziesiąt osiem minut, na poziomie low w pięćdziesiąt pięć. Na poziomie medium ta sama mapa zajęła trzy godziny dwadzieścia cztery minuty i nie powstała, a na poziomie xhigh — cztery godziny i również nie powstała.
Ile kodu powstało
Liczba znaków kodu nie mówi nic o jakości, ale pokazuje charakter modelu. Najwięcej napisał Qwen3-Coder-Next: siedemdziesiąt jeden tysięcy znaków na mapę i pięćdziesiąt siedem tysięcy na scenę 3D, przy zerowym efekcie widocznym na ekranie. Najmniej Gemma 4 26B — dwadzieścia pięć tysięcy. Wersje bez myślenia konsekwentnie produkowały więcej kodu niż wersje z myśleniem u tego samego modelu, i częściej ten kod się wywracał.
Bateria: prędkość pisania
W baterii mierzyliśmy to samo inaczej — znakami na sekundę, licząc razem odpowiedź i rozumowanie. Zestawienie przed kwantyzacją i po niej jest w zakładce Kwantyzacja. Rząd wielkości dla wszystkich trzech modeli na tym sprzęcie: od siedemdziesięciu do stu czterdziestu znaków na sekundę, zależnie od modelu, trybu i długości materiału wejściowego.
Charakter modeli.
Czym każdy okazał się w praktyce i do czego się w tym teście nadał.
Qwen 3.6-35B-A3B
Szybki na tekście — sześćdziesiąt siedem sekund na ocenę pięćdziesięciu pięciu tysięcy znaków — i jako jedyny wyłapał w ocenianym materiale barierę językową, której nie zauważył żaden inny model. W baterii: pułapka 5/5, format JSON zgodny, odczyt tabeli 3/4, wywoływanie narzędzi bez zarzutu.
Na kodzie graficznym bezradny w obu trybach: tor gry zbudował jako pustą krzywą, a mapa bez myślenia wywraca się przy pierwszej etykiecie. Najlepszy stosunek jakości do czasu przy czytaniu i ocenie tekstu.
Qwen 3.8-27B
Trzy poziomy wysiłku, z których domyślny jest najwyższy. Im więcej myślenia, tym gorzej: poziom low działa i dał najlepszą z Qwenowych scen 3D, medium potrafi po trzech godzinach oddać zero kodu, a xhigh nie oddał niczego w żadnym z trzech zadań.
Na tekście poziom medium dał najbogatszą analizę całego testu, ale kosztowała szesnaście i pół minuty tam, gdzie Gemma 26B potrzebowała minuty. Uruchamianie go bez jawnego ustawienia poziomu na low jest błędem.
Gemma 4 26B-A4B
Najszybszy model całego testu i najlepszy czytelnik. Cały przegląd w siedemnaście minut. Na dokumentach podniosła zarzuty, których nie podniósł nikt inny — sprzeczność wewnętrzną, niezdefiniowane pojęcie kluczowe i brak bezpiecznych odpowiedzi tam, gdzie materiał wymienia same zakazy.
Jej wersja gry jest jedyną wśród modeli lokalnych, którą da się przejechać, choć wygląda ubogo. Słabość odsłoniła bateria: odczyt tabeli ze zrzutu 1/4, najgorzej z całej trójki. Czyta tekst świetnie, obrazki słabo.
Gemma 4 31B
Jedyny model lokalny, który narysował coś przypominającego mapę miasta: rzeka, ulice, zabudowa i dziesięć etykiet miejsc. Jego wersja gry z myśleniem ma wyspę, domy i latarnię morską. Żadna z tych rzeczy nie działa na tyle, żeby ją pokazać: mapa ucieka za krawędź, a po wyspie nie da się jeździć.
Kosztuje pięciokrotnie więcej czasu niż mniejsza Gemma. Na dokumentach jako jedyny trzymał werdykt negatywny w obu trybach i sam zaproponował rozwiązanie zamiast poprzestać na wyliczeniu wad.
Qwen3-Coder-Next
Osiemdziesiąt miliardów parametrów i brak jakiegokolwiek sterowania myśleniem — ten model po prostu pisze. Napisał najwięcej kodu ze wszystkich i najszybciej ze wszystkich dużych, a efekt na ekranie jest zerowy: ekran startowy gry ma przycisk, który nic nie robi.
Mimo nazwy wypadł w tym teście najsłabiej ze wszystkich kandydatów do pisania kodu, który ma coś narysować.
Ornith 1.5-35B-A3B
Najrówniejszy wykonawca baterii. Jedyny, który odczytał tabelę ze zrzutu bezbłędnie w obu trybach, i jedyny, który w trybie myślenia dowiózł przy standardowym budżecie i pułapkę, i format JSON. Gadatliwy — oddaje dwa razy dłuższe odpowiedzi niż Gemma.
Jedyny bez gotowej wersji skwantyzowanej. Po kwantyzacji wykonanej na miejscu jest o jedną trzecią szybszy przy identycznych wynikach. Jego wersja gry z przeglądu odtworzyła okno warsztatu co do nazwy ulepszeń, ale scena wokół jest pusta i ciemna.
gpt-6-astra
Pracował normalnym trybem: czyta polecenie z pliku, pisze kod u siebie, uruchamia go, ogląda i poprawia. Zbudował jedyną grę z prawdziwym światem i jedyną wersję strony z kompletem etapów i przełącznikiem widoków.
Jazda w jego grze jest szarpana, a mapa na stronie nie pojawia się w kadrze — w tym jednym miejscu kontrola wzrokowa mu nie zadziałała, bo narzędzie do analizy obrazu odmówiło dostępu.
Claude / Opus
Wersja wzorcowa strony powstała w tym modelu i jest jedynym wynikiem w całym zestawieniu, który działa tak, jak opisuje polecenie. Gra wyszła słabo i nie broni się przy niczyjej wersji.
Claude / Fable
Dołączył tylko do zadania z grą. Najdokładniej odtworzył szczegóły polecenia i najlepiej trafił w sposób prowadzenia pojazdu. Za mocno obciążył pierwszą klatkę cieniami, przez co na słabszym sprzęcie strona się zacina.
Wnioski.
Pięć rzeczy, które ten test ustalił.
Modele lokalne czytają dobrze i rysują źle
Na czterdziestu przebiegach przeglądu rozkład jest jednoznaczny. Wszystkie modele poza jednym przebiegiem oddały użyteczną ocenę dokumentów w czasie od minuty do kilkunastu minut, a część z nich podniosła zarzuty, których nie postawił żaden człowiek czytający ten materiał. Na trzech zadaniach graficznych żaden z dwunastu lokalnych przebiegów nie dał wyniku nadającego się do pokazania. To nie jest kwestia rozmiaru: osiemdziesięciomiliardowy Qwen3-Coder-Next wypadł na stronie tak samo źle jak dwudziestosześciomiliardowa Gemma, tylko napisał przy tym trzy razy więcej kodu.
Więcej myślenia nie znaczy lepiej
Przy Qwenie 3.8 zależność jest odwrotna: poziom low działa, medium zapętla się, xhigh nie oddaje nic. To samo widać na tekście — wyłączenie myślenia dawało ostrzejsze werdykty niż włączenie. Przy pozostałych modelach związek między trybem a jakością okazał się przypadkowy: na stronie lepsza bywała wersja bez myślenia, na grze z myśleniem, i odwrotnie.
Budżet odpowiedzi trzeba dobrać do trybu, nie do zadania
Rozumowanie zjada ten sam limit co odpowiedź, więc model z włączonym myśleniem na limicie dobranym do trybu bez myślenia po prostu milknie. Przy pięciokrotnie większym budżecie prawie wszystkie porażki trybu myślenia zniknęły. Każda konfiguracja, która włącza myślenie, musi jednocześnie podnieść limit — inaczej puste odpowiedzi zostaną wzięte za awarię modelu.
Decyduje możliwość obejrzenia własnej pracy
Najważniejszy wynik nie dotyczy żadnego modelu z osobna. Dominujący błąd na zadaniach graficznych nie jest błędem w kodzie — kod jest poprawny, konsola milczy, a rysunek powstaje poza widocznym obszarem. Tego rodzaju pomyłki nie da się znaleźć przez czytanie kodu; trzeba zobaczyć wynik. Modele lokalne pracowały w jednym podejściu, bez możliwości sprawdzenia siebie, i wszystkie na tym poległy. Wykonawca, który sprawdza swoją pracę w przeglądarce, na trzech zadaniach z czterech wypadł wyraźnie lepiej — a tam, gdzie tej kontroli zabrakło, wpadł w dokładnie tę samą pułapkę.
Żaden wykonawca nie dostarczył wszystkiego naraz
Przy zadaniu z grą najlepszy świat zbudował jeden wykonawca, a najlepszą jazdę i najwierniejsze odtworzenie polecenia — inny. To samo w baterii: Gemma czyta tekst najszybciej, Ornith czyta obrazki najwierniej, Qwen jest najbardziej zrównoważony. Praktyczny wniosek nie brzmi „wybierz zwycięzcę”, tylko: tę samą sprawę warto puścić przez kilka modeli i zobaczyć, gdzie się rozjeżdżają.
Do czego te modele się nadają
- Praca z tekstem. Czytanie długich materiałów, streszczanie, ocena dokumentów, wyciąganie ustaleń, trzymanie narzuconego formatu, odpowiadanie na pytania o treść. Tu modele lokalne są szybkie i wystarczająco dokładne.
- Wywoływanie narzędzi. Wszystkie trzy modele baterii przeszły ten test w obu trybach. Agentowość nie jest wąskim gardłem.
- Odczyt zrzutów ekranu i tabel z obrazów — ale tylko przy modelu, który to potrafi. Rozrzut w tej jednej umiejętności był większy niż we wszystkim innym, więc trzeba ją sprawdzić osobno i nie zakładać z nazwy modelu.
- Nie do zadań, których wynikiem jest coś widocznego na ekranie — chyba że wykonawca ma możliwość obejrzenia i poprawienia tego, co zbudował.
- Modele gęste kosztują pięciokrotnie więcej czasu przy tej samej albo gorszej jakości. Przy tym samym sprzęcie wybór pada na modele z ekspertami.
Linki do wyników.
Każdy plik dokładnie taki, jaki oddał wykonawca. Nikt po nikim nie poprawiał ani jednej linii.
Modele zewnętrzne
| wykonawca | gra | mapa 2D | scena 3D |
|---|---|---|---|
| gpt-6-astra, agent | otwórz | otwórz | otwórz |
| Claude / Opus (wzorzec) | otwórz | otwórz | otwórz |
| Claude / Fable | otwórz | nie robione | nie robione |
Qwen 3.6-35B-A3B
| tryb | gra | mapa 2D | scena 3D | ludzik |
|---|---|---|---|---|
| bez myślenia | otwórz | otwórz | otwórz | otwórz |
| z myśleniem | otwórz | otwórz | otwórz | otwórz |
Qwen 3.8-27B
| tryb | gra | mapa 2D | scena 3D |
|---|---|---|---|
| bez myślenia | otwórz | otwórz | otwórz |
| poziom low | otwórz | otwórz | otwórz |
| poziom medium | brak wyniku | zero kodu po 3 h 24 min | otwórz |
| poziom xhigh | brak wyniku | zero kodu po 4 h | zero kodu po 4 h |
Gemma 4 26B-A4B
| tryb | gra | mapa 2D | scena 3D | ludzik |
|---|---|---|---|---|
| bez myślenia | otwórz | otwórz | otwórz | otwórz |
| z myśleniem | otwórz | otwórz | otwórz | otwórz |
Gemma 4 31B
| tryb | gra | mapa 2D | scena 3D |
|---|---|---|---|
| bez myślenia | otwórz | otwórz | otwórz |
| z myśleniem | otwórz | otwórz | otwórz |
Qwen3-Coder-Next 80B
| tryb | gra | mapa 2D | scena 3D |
|---|---|---|---|
| jedyny tryb | otwórz | otwórz | otwórz |
Ornith
| wersja i tryb | gra | mapa 2D | scena 3D | ludzik |
|---|---|---|---|---|
| 1.0 bez myślenia | otwórz | otwórz | otwórz | — |
| 1.0 z myśleniem | otwórz | otwórz | otwórz | — |
| 1.5 bez myślenia | — | — | — | otwórz |
| 1.5 z myśleniem | — | — | — | otwórz |
| 1.5 FP8 bez myślenia | otwórz | otwórz | otwórz | otwórz |
| 1.5 FP8 z myśleniem | przerwany | otwórz | otwórz | otwórz |
Ornith 1.0 przeszedł przegląd, Ornith 1.5 FP8 dostał te same trzy zadania później i jest w tabelach osobno. Spis wszystkich ośmiu podejść do ludzika na mapie: chlopek.
Słowniczek.
Pojęcia użyte na tej stronie, wyjaśnione raz.
| model językowy | Program, który dostaje tekst i dopisuje do niego ciąg dalszy, wyliczając każde kolejne słowo. Dwa zapytania o to samo dają dwie różne odpowiedzi. |
| myślenie modelu | Tryb, w którym model przed odpowiedzią pisze dla siebie rozumowanie, niewidoczne dla użytkownika, ale zużywające czas i przyznany budżet. |
| poziom wysiłku | Dodatkowe ustawienie w niektórych modelach, mówiące, jak długo mają myśleć. W Qwenie 3.8 przyjmuje wartości low, medium i xhigh, a domyślną jest xhigh. |
| model z ekspertami | Konstrukcja, w której model ma dużo parametrów, ale przy każdym słowie używa tylko ich ułamka. Waży jak duży, liczy jak mały. |
| model gęsty | Konstrukcja, w której przy każdym słowie pracują wszystkie parametry. Wolniejszy od modelu z ekspertami o podobnym rozmiarze. |
| kwantyzacja FP8 | Zapisanie modelu mniejszą liczbą bitów na wartość — z dwóch bajtów na jeden. Mniej miejsca i szybsze liczenie kosztem drobnej utraty dokładności. |
| warstwa stanowa | Inny sposób budowy warstwy modelu niż klasyczna uwaga: zamiast porównywać każde słowo z każdym, przesuwa przez tekst wewnętrzny stan. Tańsza przy długich materiałach, ale kwantyzuje się inaczej. |
| okno kontekstu | Ile tekstu model jest w stanie mieć przed oczami naraz — polecenie i własną odpowiedź łącznie. |
| budżet odpowiedzi | Górny limit długości tego, co model napisze w jednym podejściu. Po jego wyczerpaniu odpowiedź urywa się w pół zdania, a przy włączonym myśleniu może się skończyć, zanim model zacznie odpowiadać. |
| pamięć kontekstu | Miejsce, w którym serwer trzyma przetworzoną już część rozmowy, żeby nie liczyć jej od nowa. Jej wielkość decyduje, ile długich sesji naraz obsłuży maszyna. |
| szablon rozmowy | Plik dołączony do modelu, określający, jak układa się przekazywane mu polecenie i jakie przełączniki model rozumie. Jedyne wiarygodne źródło informacji o tym, czy model potrafi myśleć na głos. |
| grafika wektorowa | Rysowanie obrazka poleceniami „linia stąd dotąd”, zamiast zapisywania go jako zdjęcia. Skaluje się bez utraty ostrości. |
| konsola przeglądarki | Miejsce, w którym przeglądarka wypisuje błędy strony. Użytkownik jej nie widzi i dostaje tylko skutek — pusty ekran albo brakujący element. |
| pętla rysowania | Kod wykonywany kilkadziesiąt razy na sekundę, który przerysowuje ruchomy obraz. Jeden błąd w tej pętli zatrzymuje całą scenę. |
| mapa cieni | Pomocniczy obraz, z którego przeglądarka odczytuje, co rzuca cień na co. Im większy, tym ładniejsze cienie i tym wolniejsze rysowanie. |
| wywoływanie narzędzi | Zdolność modelu do samodzielnego wybrania narzędzia, wywołania go z właściwymi argumentami, odczytania wyniku i wykonania na tej podstawie kolejnego kroku. |
O pomiarach
Wszystkie czasy są zmierzone, żaden nie jest szacunkiem. Każdy pochodzi z jednego podejścia — przebiegów nie powtarzaliśmy, więc żadna liczba nie jest średnią. Surowe odpowiedzi modeli, łącznie z zapisem rozumowania, są zachowane.
CRODU · crodu.com · hello@crodu.com