Ja zoals de anderen zeiden, idd via huggingface, het Unsloth model. :-)
Ik heb een lokaal aangepaste versie van llama.cpp TheTom/TurboQuant draaien (zoals je al weet) waardoor ik mijn model op kan splitsen over CUDA en ROCm (moest ik een llama.cpp upstream bugfix voor importeren naar TheTom/TQ) waardoor ik genoeg VRAM heb om Q6 volledig in VRAM te draaien op mijn RTX 3090 (24 GB) en RX 6700 XT (12 GB) met een KV cache van 256k op turbo4/turbo3 KV cache quant.
Dit terzijde, ondertussen heb ik mijn clustertje van 3x RTX 3070 en 6x GTX 1070 ook draaiende. Plaatje bijgevoegd. Heb er een oude Kallax voor uit de woonkamer gehaald (vrouw ook blij, die wilde al jaren van dat ding af) en met mijn 3d printer wat custom GPU mounts gemaakt.
72 GB VRAM, heb er deze week mee met DeepSeek V4 Flash 0731 op zitten spelen. Heb DwarfStar 4 gepakt als basis inference engine, en loop daar nu aan te sleutelen om hem maar sneller te krijgen.
Stock DwarfStar 4 haalde ik ~4 tok/s mee, na mijn eerste optimalisatie heb ik nu een prefill van 30 tok/s en een decode van 8 tok/s, en ik ben nu bezig met een nieuw algoritme waarmee ik misschien wel de 16 tok/s aan kan tikken, met een beetje mazzel.
Daarna heb ik denk ik wel de grens bereikt van wat ik kan doen met zoveel oude GPUs. x)
Voor de nieuwsgierigen:
- Stroomverbruik: Als dat ding idle staat te staan verbruikt ie ongeveer 100W, als ik er op het moment actief inference op draai tikt ie de 500W aan.
- Model: Ik gebruik DeepSeek V4 Flash 0731 Q2_XSS (~81 GB)
- VRAM gebruik: Ongeveer 2/3de van het model past in mijn VRAM na KV Cache van 256k, CUDA buffers, etc.
- Geluidsniveau: Eigenlijk best stil, die 140mm fans draaien op half vermogen en houden het geheel op ongeveer 50-60c tijdens inference, 40c idle.
- Operating system is Ubuntu headless server
- Systeem is gebouwd op OCuLink adapters en kabels.
- Wat heeft me dit gekost: Mijn sanity, wat OCuLink apparatuur (€300), en 2 rollen ABS van een kilo. De grafische kaarten, voedingen, moederbord, RAM, etc. heb ik van de stort gered toen het bedrijf waar ik voor werkte sloot en IT alles naar de stort ging brengen.
- Wat heeft het me opgeleverd: Diepere kennis van hoe inference engines werken, en een apparaat waar ik met trots over kan praten. xD