gibraltar schreef op zondag 13 september 2026 @ 20:56:
[...]
Normaalgesproken zou je een goed punt hebben, maar bij Q4 heb je token prediction met snelheidswinst. Die MTP is er niet bij Q3 (ik weet niet waarom). En Q4 past op deze manier en de kwaliteit is echt heel goed te noemen. Langere taken voert hij kwalitatief goed uit en tool calls zijn indrukwekkend. En de snelheid die ik ervaar is vergelijkbaar met Gemini in Antigravity.
Nou, ik ben eens aan het testen gegaan met
Q2_K_XL en Q4_M vanavond (alhoewel... ik heb vooral zitten wachten met meer dan 210 GB te downloaden

). Samenvatting: ik zie die MTP snelheden bij de Q4 toch nog niet zo (het lijkt namelijk of die ook met Q2 gewoon al werkt).
Alles gedaan met 32K context, thinking medium, KV cache F16 op een pc met 64GB DDR-3200. Daarnaast dus ook MTP aangezet in unsloth, dat geeft ook bij Q2 geen foutmeldingen als ik het model daarmee laad. Prompt is steeds weer "Schrijf een essay van 2000 woorden over Beethoven" en vervolgens "Leuk, maar schrijf nu iets vergelijkbaars in 2000 woorden over Bach". De snelheid is steeds in outputtokens.
Q2_K_XL:
Single RTX 5090 in unsloth: 45 tokens/s.
RTX 5090 + 5060 Ti in unsloth: 60 tokens/s.
Q4_K_M:
RTX 5090 + 5060 Ti in ollama: 20 tokens/s
RTX 5090 + 5060 Ti in unsloth: 23 tokens/s
RTX 5090 + 5060 Ti in unsloth met Q4_1 KV cache: 24 tokens/s
Beduidend lagere snelheid dus en ik moet ook zeggen dat bij het laden unsloth ook een waarschuwing geeft dat het niet in het vram past (bij Q2 krijg ik die melding niet).
Vervolgens nog een test met Q2_K_XL gedaan met volle 256K context:
RTX 5090 + 5060 Ti in unsloth: 40 tokens/s
Single RTX 5090: 30 tokens/s
MTP heb ik wel uitstaan, want aanzetten kost meer ram offloading en maakt het bij mij dus juist trager lijkt het?
Overweging om niet voor Q1_M te gaan: dit model is 74,5GB groot, Q2_K_XL 79GB. Voelt dus meer als een sweet spot. Moet zeggen dat zelfs een single RTX 5090 mij meevalt, ik denk inderdaad dat OpenClaw een nieuwe hersenpan krijgt

en 27B vaarwel wordt gezegd. Ik ga nog wel even twijfelen of ik de 5060 Ti er ook voor ga gebruiken, 30 tokens/s is eigenlijk net niet lekker werken met een bot, 40 tokens/s is nog net acceptabel maar ja het kost ook wel weer een sloot extra energie :P. Maar voor de programmeurs hier die de boel 's nachts aan het rekenen kunnen zetten en snelheid minder belangrijk is, dus goed nieuws dat je met 32GB Vram de Q2 prima kan draaien. Ik merk in de kwaliteit van die essays ook sowieso weer een kwaliteitsslag, stuk minder rommeligheden/foutjes dan 27B. Voor wie hem kan draaien is het dus zeker een aanrader.
[
Voor 6% gewijzigd door
DeNachtwacht op 22-09-2026 15:50
]