Review: Nieuwste hardware voor vertrouwde Macs

Pagina: 1
Acties:

  • kipppertje
  • Registratie: Mei 2010
  • Laatst online: 17:00
Artikel: review: Mac mini (M6) en Mac Studio (M5 Ultra) - Nieuwste hardware voor vertrouwde Macs

Auteur: @Tomas Hochstenbach

Ik had mijn relaas al als comment onder het artikel gezet, maar misschien is dit een beter plek. Allereerst, hulde voor het doen van een benchmark van een 120b, daar koop je zo'n M5 Ultra met 256GB tenslotte voor. Ik begrijp alleen de gekozen modellen niet. Een GLM5.3-flash of Qwen3.8-flash-next lijkt me veel logischer? Er is waarschijnlijk niemand die GPT-OSS 120B gaat draaien, want waarom zou je? En waarom de benchmark op Qwen3.5? Qwen3.8 is een stuk relevanter. Dus tenzij je geïnteresseerd bent in retro-modellen is de keuze wat opmerkelijk.

Verder was ik benieuwd wat de MoE-modellen doen in de benchmark, zeker ten opzichte van een videokaart. Bij een MoE-model is een geïntegreerd systeem namelijk veel minder in het nadeel dan bij de dense-modellen die jullie nu hebben gebruikt.

Los daarvan, waarom wordt de quantization niet genoemd? Die moet gebruikt zijn, want het volledige model van Qwen3.5 is 56GB en past dus niet op de meeste systemen waarop de benchmark gedaan is. Juist voor Mac is het relevant om te noemen, want als je de niet-MLX versie pakt dan krijg je significant minder goede prestaties die niet representatief zijn, en als je verschillende quatizations door elkaar zou gebruiken dan ben je helemaal appels met peren aan het vergelijken.

Kortom: kunnen jullie voortaan relevante en moderne modellen gebruiken, de softwarestack noemen (waarop heb je het getest, ook dat kan enorme verschillen met zich meebrengen) en welke quantization is gebruikt? Anders zeggen de benchmarks zo weinig.

[ Voor 16% gewijzigd door kipppertje op 25-09-2026 15:35 ]

Maar het had ook zo gekunt


  • Tomas Hochstenbach
  • Registratie: Januari 2009
  • Laatst online: 18:25

Tomas Hochstenbach

Redacteur componenten
Hi @kipppertje

In onze reviews zul je zelden benchmarks van de állernieuwste AI-modellen aantreffen. Dat komt doordat het voornaamste doel niet is om te kijken wat het beste of snelste AI-model is, maar om apparaten met elkaar te vergelijken: we willen weten hoe de Mac Studio zich verhoudt tot andere AI-systemen.

Daarvoor moeten we de testmethode langere tijd vastzetten. De DGX Spark en MacBook Pro met M5 Max zijn bijvoorbeeld al teruggestuurd naar de fabrikant; in een test met een gloednieuw AI-model hadden die ontbroken als vergelijkingsmateriaal. Dat had ik kwalijker gevonden dan dat we een wat oudere versie van Qwen draaien, zeker omdat modellen met dezelfde karakteristieken (grootte, dense/MoE, quantization) doorgaans ongeveer gelijke onderlinge verhoudingen tussen hardware laten zien.

Alle informatie over dense vs. MoE-modellen, gebruikte backend en quantization vind je in de review als je het kader 'Lees meer over onze testmethode voor AI-benchmarks' openklapt.

Overigens komt er binnenkort een test aan van andere nieuwe AI-hardware met een groot gedeeld geheugen. Ik ga kijken of ik daarvoor óók een nieuwer en groter model mee kan nemen en dat dan meteen ter vergelijking op de Studio kan draaien; resultaten van een Spark en M5 Max zal ik daarbij dus helaas niet kunnen opnemen.

Hopelijk helpt dit!

  • kipppertje
  • Registratie: Mei 2010
  • Laatst online: 17:00
Tomas Hochstenbach schreef op vrijdag 25 september 2026 @ 15:49:
Hi @kipppertje

In onze reviews zul je zelden benchmarks van de állernieuwste AI-modellen aantreffen. Dat komt doordat het voornaamste doel niet is om te kijken wat het beste of snelste AI-model is, maar om apparaten met elkaar te vergelijken: we willen weten hoe de Mac Studio zich verhoudt tot andere AI-systemen.

Daarvoor moeten we de testmethode langere tijd vastzetten. De DGX Spark en MacBook Pro met M5 Max zijn bijvoorbeeld al teruggestuurd naar de fabrikant; in een test met een gloednieuw AI-model hadden die ontbroken als vergelijkingsmateriaal. Dat had ik kwalijker gevonden dan dat we een wat oudere versie van Qwen draaien, zeker omdat modellen met dezelfde karakteristieken (grootte, dense/MoE, quantization) doorgaans ongeveer gelijke onderlinge verhoudingen tussen hardware laten zien.

Alle informatie over dense vs. MoE-modellen, gebruikte backend en quantization vind je in de review als je het kader 'Lees meer over onze testmethode voor AI-benchmarks' openklapt.

Overigens komt er binnenkort een test aan van andere nieuwe AI-hardware met een groot gedeeld geheugen. Ik ga kijken of ik daarvoor óók een nieuwer en groter model mee kan nemen en dat dan meteen ter vergelijking op de Studio kan draaien; resultaten van een Spark en M5 Max zal ik daarbij dus helaas niet kunnen opnemen.

Hopelijk helpt dit!
Thnx voor de uitleg! Blijft wel de vraag staan, gebruiken jullie op Mac de MLX versies?

En is het wellicht een idee om naast dezelfde modellen die je op alle hardware draait, ook het meest waarschijnlijke model dat je gaat draaien mee te nemen, ook al mis je dan vergelijkingsmateriaal? Dat is toch eigenlijk wel de vraag die je beantwoord wil hebben als je de hardware speciaal voor AI koopt. De vraag hoe goed draait GLM5.3-flash op zo'n Mac studio is best relevant, omdat dit momenteel het model is wat het dichtst in de buurt komt van een Claude Opus of een ChatGPT. Voor de Mac Mini zal dat wellicht de Qwen3.8:27B-MLX Q4 zijn.

Maar het had ook zo gekunt


  • Tomas Hochstenbach
  • Registratie: Januari 2009
  • Laatst online: 18:25

Tomas Hochstenbach

Redacteur componenten
kipppertje schreef op vrijdag 25 september 2026 @ 16:59:
[...]

Thnx voor de uitleg! Blijft wel de vraag staan, gebruiken jullie op Mac de MLX versies?
Nee, we draaien op ieder systeem exact hetzelfde model.
En is het wellicht een idee om naast dezelfde modellen die je op alle hardware draait, ook het meest waarschijnlijke model dat je gaat draaien mee te nemen, ook al mis je dan vergelijkingsmateriaal? Dat is toch eigenlijk wel de vraag die je beantwoord wil hebben als je de hardware speciaal voor AI koopt. De vraag hoe goed draait GLM5.3-flash op zo'n Mac studio is best relevant, omdat dit momenteel het model is wat het dichtst in de buurt komt van een Claude Opus of een ChatGPT. Voor de Mac Mini zal dat wellicht de Qwen3.8:27B-MLX Q4 zijn.
Ja, het lijkt me een goed idee om een nieuwer, voor het gereviewde apparaat relevant model mee te nemen, ook al mist er dan context van hoe andere apparaten presteren.

Het probleem daarmee is wel dat 'het meest waarschijnlijke model dat je gaat draaien' nogal subjectief is. Er meldt zich ongetwijfeld iemand in de reacties die dan juist graag weer een ander model had gezien - het is ook maar net wat je use case is en wat je fijn vindt. Uiteindelijk moeten we natuurlijk ergens stoppen.