Ervaringen met zelf gehoste AI assistenten

Pagina: 1 2 3 4 5 Laatste
Acties:

  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
rbrtb schreef op donderdag 23 juli 2026 @ 19:48:
Hallo allemaal, beginner hier. Ik wil langzaam ook meer gebruik gaan maken van programmeren met behulp van lokale LLMs. Zoals ik van iedereen in dit topic begrijp is een videokaart met 32 GB RAM wel een vereiste om krachtigere modellen te draaien. Daarom ben ik van plan een Asus Radeon AI Pro R9700 te kopen (of vergelijkbaar).

Probleem wat ik heb is dat mijn computer in de woonkamer staat, en het geluid van een blower (zover ik weet hebben alle R9700s een blower) niet compatible is met andere gezinsleden die graag een rustige avond willen hebben. Nu begrijp ik dat je de herrie beperkt kunt houden door de kaart te beperken door de kaart power met 10-30% terug te schroeven.

Aangezien hier meerdere mensen met workstation GPUs (met blower) lijken te posten, hoe is jullie ervaring hiermee? Kun je zo'n kaart fatsoenlijk stil krijgen?
Ik heb zelf een PC met upgrade pad van
  • 4070 Super (12GB, geen blower, luid en irritant)
  • Intel Arc Pro B60 (24GB Vram, blower en relatief rustig)
  • en nu een Intel Arc Pro B70 (32GB Vram, blower en daar wordt je niet blij van in dezelfde ruimte, ik zet de GPU op max 40% vermogen als de jongeste naar bed gaat en PC staat in de kamer ernaast :+).
Qua performance is de B60 niet gelijk aan de 4070 qua rekenkracht maar door het vele hogere Vram kan ik desondanks modellen draaien die met de 4070 niet haalbaar waren. De B70 lijkt qua rekenkracht op 5060/5070 niveau te zitten maar dan wel met 32GB Vram.
Met llama.cpp SYCL zijn de performance metrics de afgelopen maanden vooral op prompt processing behoorlijk verbeterd.

De kostprijs was voor mij reden om in ieder geval de B60 te proberen (~700 euro) en ook te upgraden naar de B70 (~1300 euro).

Ik had ook een 5070 Ti geprobeerd maar om onbekende redenen wilde mijn PC daarmee niet booten ondanks ruim voldoende voeding. Achteraf blij met de Intel wat veel meer Vram :D

Ik draag een rok, wat is jouw excuus?


  • rbrtb
  • Registratie: Juni 2024
  • Laatst online: 11:33
Felicia schreef op vrijdag 24 juli 2026 @ 20:13:
[...]

Ik heb zelf een PC met upgrade pad van
  • 4070 Super (12GB, geen blower, luid en irritant)
  • Intel Arc Pro B60 (24GB Vram, blower en relatief rustig)
  • en nu een Intel Arc Pro B70 (32GB Vram, blower en daar wordt je niet blij van in dezelfde ruimte, ik zet de GPU op max 40% vermogen als de jongeste naar bed gaat en PC staat in de kamer ernaast :+).
Bedankt voor je reactie! Aangezien je het hele pad hebt doorlopen, vond je kwaliteit van de grotere modellen (12GB->24GB->32GB) de upgrades waard?

Zelf ben ik van plan de LLMs te gebruiken als coding assistenten voor uit de hand gelopen hobby projecten in c++.

Ik twijfel nog steeds een beetje tussen een AMD 9070 (ie. 16GB, dus 'weinig' VRAM, maar wel stil en nog niet al te duur) en een Intel b60/ AMD R9700 (veel VRAM en duurder/luider). Op het moment heb ik nog een oude RTX2070 non-super (8 GB) in mijn PC.

  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
rbrtb schreef op zaterdag 25 juli 2026 @ 21:29:
[...]

Bedankt voor je reactie! Aangezien je het hele pad hebt doorlopen, vond je kwaliteit van de grotere modellen (12GB->24GB->32GB) de upgrades waard?
Ik gebruik nu vooral Qwen 35b Q4_K_M en dat paste op de 24GB met zo'n 128k context. Dat was erg goed te doen qua snelheid. Met de laatste ontwikkelingen rondom prompt processing in llama.cpp ben ik nog blijer (prompt processing is grofweg verdubbeld en de vertraging bij grotere contexten is veel kleiner). Met volledige context zit die rond de 25GB Vram.
Het enige wat "irritant" is, is dat het model in Windows na zo'n 30 seconde inactiviteit automatisch naar RAM geladen wordt, dit lijkt een Intel power-saving feature die ik niet uit kan zetten. Ik heb dus een simpele webconsole waarmee ik van model kan wisselen die ook 1x per 30s een prompt stuurt (met Hi en 1 token aan reactie verwacht).
Zelf ben ik van plan de LLMs te gebruiken als coding assistenten voor uit de hand gelopen hobby projecten in c++.
Ik zit met name te klooien met hobby projecten voor werk zoals een branch standaard (process en messaging structuur) een demo-app geven die we wellicht ooit willen inzetten.
Daarnaast vooral vanuit werk om SQL scripts snel op te zetten zonder al te veel code te hoeven schrijven :D (ja, baas heeft me nog geen Github copilot licentie gegegeven).
Ik twijfel nog steeds een beetje tussen een AMD 9070 (ie. 16GB, dus 'weinig' VRAM, maar wel stil en nog niet al te duur) en een Intel b60/ AMD R9700 (veel VRAM en duurder/luider). Op het moment heb ik nog een oude RTX2070 non-super (8 GB) in mijn PC.
Ik weet niet waar je woont maar ik heb de B60 hier nog in de kast liggen, Ik kan best even langsrijden als je 'm wil testen als het niet te ver uit de buurt is :) (heb toch nog 3 weken vakantie).

Ik draag een rok, wat is jouw excuus?


  • shaowoo
  • Registratie: Mei 2005
  • Laatst online: 26-07 14:30
@Felicia is er een reden waarom je niet gekozen hebt voor Qwen 3.6 27B ?

ik ben nml ook aan het experimenteren om te kijken wat ik redelijkerwijs kan draaien op mijn pc (rtx5060TI 16gb met 64 gb RAM), ollama gekoppeld aan hermes-agent. Met regelmaat controleer ik :Small Open Source Models | Artificial Analysis

Voor periodieke taken is de traagheid niet zo erg maar als ik bezig ben om te en taak te ontwikkelen dan is het best 'vervelend'. Een qwen 3.5 merkte ik vaak dat het in een soort cirkel redenatie blijft hangen.

IT Freelancer since 2005, and still loving it.


  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
shaowoo schreef op zondag 26 juli 2026 @ 12:36:
@Felicia is er een reden waarom je niet gekozen hebt voor Qwen 3.6 27B ?
23-24tps genereren voor 27b en 50-60 voor 35b. Ook prompt processing is veel sneller met 35b, met de laatste SYCL release zo'n 1100 tps. Qua qualiteit en benchmarks zie ik geen verschil dus ik hou 't lekker bij 35b :)

En ik heb iets gedaan waardoor de 27b nu alleen gibberish uitspuugt, ook met nieuwere llama.cpp versies. Zelfde met Gemma 4 31b dus I gone an' fucked something up :P

Ik draag een rok, wat is jouw excuus?


  • Deepflame
  • Registratie: Juni 2025
  • Laatst online: 26-07 15:17
Felicia schreef op zondag 26 juli 2026 @ 12:46:
[...]

23-24tps genereren voor 27b en 50-60 voor 35b. Ook prompt processing is veel sneller met 35b, met de laatste SYCL release zo'n 1100 tps. Qua qualiteit en benchmarks zie ik geen verschil dus ik hou 't lekker bij 35b :)

...
Dat was ook zo'n beetje mijn conclusie. Er zijn wel verschillen, maar ze zijn subtiel, en als je een groter model reviews laat doen, dan corrigeert dat gemakkelijk voor het kleine beetje verlies wat je oploopt, terwijl je wel alle snelheid van 35b pakt. :)

  • ZatarraNL
  • Registratie: Mei 2015
  • Laatst online: 15:06
Ik draai al een tijdje ollama met een rtx5060ti (16Gb vram). Ik wil de inzetten als agent in home assistant. Ik gebruik nu gemma4:e4b (8.0B) samen met faster-Whisper voor stt (gebruikt 3Gb vram). Ik vind het moeilijk om voor home assistant de sweet spot te vinden.

Wat is jullie ervaring? Is dit de juiste route? Moet ik zelf gaan tweaken met iets anders dan ollama? Is gemma4:e4b de sweet spot voor home assistant? Heb ik nog dingen over het hoofd gezien?

Mijn ideale situatie: spreken tegen de agent die de juiste acties uitvoert (gaat mij nog vaak mis) en als agent automations aanmaken en verbeteren. Oftewel een beetje supervised beheer over home assistant.

  • rbrtb
  • Registratie: Juni 2024
  • Laatst online: 11:33
Felicia schreef op zaterdag 25 juli 2026 @ 21:50:
[...]

Ik weet niet waar je woont maar ik heb de B60 hier nog in de kast liggen, Ik kan best even langsrijden als je 'm wil testen als het niet te ver uit de buurt is :) (heb toch nog 3 weken vakantie).
Bedankt voor het aanbod, maar ik woon in het buitenland (Midden-Oosten), dus dat wordt een lastige... :(

  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
rbrtb schreef op zondag 26 juli 2026 @ 21:32:
[...]

Bedankt voor het aanbod, maar ik woon in het buitenland (Midden-Oosten), dus dat wordt een lastige... :(
Dat een beetje ver rijden ja :+

Ik draag een rok, wat is jouw excuus?


  • Puff_Uncle
  • Registratie: Februari 2020
  • Laatst online: 13:15
ZatarraNL schreef op zondag 26 juli 2026 @ 18:43:
Ik draai al een tijdje ollama met een rtx5060ti (16Gb vram). Ik wil de inzetten als agent in home assistant. Ik gebruik nu gemma4:e4b (8.0B) samen met faster-Whisper voor stt (gebruikt 3Gb vram). Ik vind het moeilijk om voor home assistant de sweet spot te vinden.

Wat is jullie ervaring? Is dit de juiste route? Moet ik zelf gaan tweaken met iets anders dan ollama? Is gemma4:e4b de sweet spot voor home assistant? Heb ik nog dingen over het hoofd gezien?

Mijn ideale situatie: spreken tegen de agent die de juiste acties uitvoert (gaat mij nog vaak mis) en als agent automations aanmaken en verbeteren. Oftewel een beetje supervised beheer over home assistant.
wat voor mij werkt is hermes draaien of iets anders waarmee je MCP servers kan koppelen en dan de home assistant mcp server deze gebruik ik https://github.com/homeassistant-ai/ha-mcp.

Voor het model gaat het lastig zijn om lokaal te draaien met 16Gb vram die consistente tool calls kan doen en op redelijke snelheid. Er komt namelijk veel context bij en meerdere tool calls als je via de MCP weg wilt. Waardoor het lokaal gelijk een stuk slomer is met prompt processing. Je kan het ook toevoegen in HA(zonder een agent dus waarschijnlijk veel sneller) maar voor zover ik weet kan die alleen apparaten aansturen en geen automations maken maar misschien zijn daar al updates/add-ons voor.

  • CSB
  • Registratie: Juli 2003
  • Laatst online: 15:39

CSB

:D

Puff_Uncle schreef op maandag 27 juli 2026 @ 09:44:
[...]

wat voor mij werkt is hermes draaien of iets anders waarmee je MCP servers kan koppelen en dan de home assistant mcp server deze gebruik ik https://github.com/homeassistant-ai/ha-mcp.

Voor het model gaat het lastig zijn om lokaal te draaien met 16Gb vram die consistente tool calls kan doen en op redelijke snelheid. Er komt namelijk veel context bij en meerdere tool calls als je via de MCP weg wilt. Waardoor het lokaal gelijk een stuk slomer is met prompt processing. Je kan het ook toevoegen in HA(zonder een agent dus waarschijnlijk veel sneller) maar voor zover ik weet kan die alleen apparaten aansturen en geen automations maken maar misschien zijn daar al updates/add-ons voor.
Ik heb sinds kort Hermes Agent draaien en gekoppeld aan Home Assistant middels een zgn. long-lived-access token, specifiek voor een user die ik vooraf heb aangemaakt in HA (met basic rechten). Hierdoor kan Hermes HA zaken uitlezen en aansturen die ik vooraf aan de gebruiker heb toegekend en meer niet. Ik moet nog wel verder uitzoeken wat ik er allemaal nog meer mee kan dan simpel wat zaken schakelen, maar dat staat op de backlog. 8)

Sowieso is het draaien van Hermes in mijn A.I. stack de oorzaak van een enorme stroomversnelling aan verbeteringen in mijn interne netwerk; ik heb nu een LLM-Wiki om het long-term memory van de Agent in op te slaan, heb een lang gekoesterde wens voor een RAG pipeline gerealiseerd, werk met een Telegram bot om remote notificaties en chats met Hermes te kunnen doen en heb intern een Kanban bord gemaakt om "tickets" die ik of Hermes aanmaak(t) (errors, updates, upgrades, etc.) te kunnen beoordelen en verwerken. Netjes workflows koppelen middels n8n zodat je de meeste koppelingen via een centraal koppelvlak hebt lopen voor overzicht en daarna tweaken tot je een ons weegt om het allemaal goed te laten werken... :P

En dat alles in 1 week tijd, sinds implementatie van Hermes. Ik moet daarbij wel eerlijk zijn: het heeft aardig wat trial en error gekost om het goed en soepel in te regelen en ik heb nog wat minor issues die ik moet gaan wegwerken, maar op een PC met een RTX4070S en 32GB DDR5 RAM werkt Qwen3.6 35B A3B prima met Hermes (128k context met room to spare).

Met zo'n administrator heb je geen users meer nodig...


  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
ZatarraNL schreef op zondag 26 juli 2026 @ 18:43:
Ik draai al een tijdje ollama met een rtx5060ti (16Gb vram). Ik wil de inzetten als agent in home assistant. Ik gebruik nu gemma4:e4b (8.0B) samen met faster-Whisper voor stt (gebruikt 3Gb vram). Ik vind het moeilijk om voor home assistant de sweet spot te vinden.

Wat is jullie ervaring? Is dit de juiste route? Moet ik zelf gaan tweaken met iets anders dan ollama? Is gemma4:e4b de sweet spot voor home assistant? Heb ik nog dingen over het hoofd gezien?

Mijn ideale situatie: spreken tegen de agent die de juiste acties uitvoert (gaat mij nog vaak mis) en als agent automations aanmaken en verbeteren. Oftewel een beetje supervised beheer over home assistant.
Je kan eens naar deze kijken:
https://huggingface.co/Nanbeige/Nanbeige4.2-3B

Vanuit benchmarks lijkt deze het relatief beter te doen dan Gemma E4b. Ik zie alleen nog geen GGUF van Unsloth bijvoorbeeld maar voor het testen van een andere zou dat niet zo erg moeten zijn.

Ik draag een rok, wat is jouw excuus?


  • Ferrox1
  • Registratie: Augustus 2008
  • Laatst online: 16:13
Ik zit te wachten op de release van de mac M5 mini om juist daar modellen op te gaan draaien. Dit heb ik al getest op mijn macbook pro M1 MAX met 32GB gedeeld geheugen. Ik ben best tevreden over de resultaten van wat deze machine al kan. De M5 Mac Mini Pro zal daar nog een flinke schep bovenop gaan doen is de verwachting. Deze mac kan dan mooi headless in mijn serverhoekje draaien.

Toch zie ik hier heel veel set-ups met RTX-en voorbij komen.

De reden dat ik een mac-mini wil t.o.v. een RTX set-up zover ik heb kunnen onderzoeken:
  • stiller
  • zuiniger en efficienter (zeker als hij staat te idlen, maar ook bij het uitvoeren van de modellen)
  • unified memory, dus ook gelijk beschikbaar voor de GPU, ik neig naar minimaal 64gig. Dat betekend anders al snel een dubbele videokaart
  • kleiner (meestal)
  • goedkoper? (beetje afhankelijk van wat de prijzen nu gaan doen voor de M5 als gevolg van de geheugenprijzen)
  • zowat alle modellen draaien er ook op.
Waarom lees ik hier dan toch vaak over een RTX set-up? Ik zie daar vooral nadelen aan. Of komt dit omdat dit ook geschikt is voor gamen in tegen stelling tot een mac en dus vaak al beschikbaar is? Ik game namelijk niet vaak.

Of zie ik echt iets compleet over het hoofd? Is dit persoonlijke voorkeur?

  • Felicia
  • Registratie: Maart 2001
  • Laatst online: 15:17
Ferrox1 schreef op maandag 27 juli 2026 @ 14:13:
Waarom lees ik hier dan toch vaak over een RTX set-up? Ik zie daar vooral nadelen aan. Of komt dit omdat dit ook geschikt is voor gamen in tegen stelling tot een mac en dus vaak al beschikbaar is? Ik game namelijk niet vaak.
Volgens mij zit het verschil voornamelijk in ruwe rekenkracht en geheugen bandbreedte. Kijk hier eens voor een vergelijking tussen een 3090, 4090, 5090 en Mac 5 Pro: YouTube: RTX 3090 vs 4090 vs 5090 vs Mac M5 Max: Qwen3.6-35B-A3B Local AI Benchmark using llama.cpp

Verschillen met lagere RTX kaarten zijn natuurlijk relatief in verhouding tot de geheugenbandbreedte etc.

Ik draag een rok, wat is jouw excuus?


  • ZatarraNL
  • Registratie: Mei 2015
  • Laatst online: 15:06
Ferrox1 schreef op maandag 27 juli 2026 @ 14:13:
Ik zit te wachten op de release van de mac M5 mini om juist daar modellen op te gaan draaien. Dit heb ik al getest op mijn macbook pro M1 MAX met 32GB gedeeld geheugen. Ik ben best tevreden over de resultaten van wat deze machine al kan. De M5 Mac Mini Pro zal daar nog een flinke schep bovenop gaan doen is de verwachting. Deze mac kan dan mooi headless in mijn serverhoekje draaien.

Toch zie ik hier heel veel set-ups met RTX-en voorbij komen.

De reden dat ik een mac-mini wil t.o.v. een RTX set-up zover ik heb kunnen onderzoeken:
  • stiller
  • zuiniger en efficienter (zeker als hij staat te idlen, maar ook bij het uitvoeren van de modellen)
  • unified memory, dus ook gelijk beschikbaar voor de GPU, ik neig naar minimaal 64gig. Dat betekend anders al snel een dubbele videokaart
  • kleiner (meestal)
  • goedkoper? (beetje afhankelijk van wat de prijzen nu gaan doen voor de M5 als gevolg van de geheugenprijzen)
  • zowat alle modellen draaien er ook op.
Waarom lees ik hier dan toch vaak over een RTX set-up? Ik zie daar vooral nadelen aan. Of komt dit omdat dit ook geschikt is voor gamen in tegen stelling tot een mac en dus vaak al beschikbaar is? Ik game namelijk niet vaak.

Of zie ik echt iets compleet over het hoofd? Is dit persoonlijke voorkeur?
Ik had al een proxmoxserver en wilde niet nog een systeem draaien. De rtx5060ti met 16gb was destijds veel compute met relatief veel geheugen en betaalbaar. De Apple was toen nog niet beschikbaar.

  • CSB
  • Registratie: Juli 2003
  • Laatst online: 15:39

CSB

:D

Ferrox1 schreef op maandag 27 juli 2026 @ 14:13:
Waarom lees ik hier dan toch vaak over een RTX set-up? Ik zie daar vooral nadelen aan. Of komt dit omdat dit ook geschikt is voor gamen in tegen stelling tot een mac en dus vaak al beschikbaar is? Ik game namelijk niet vaak.

Of zie ik echt iets compleet over het hoofd? Is dit persoonlijke voorkeur?
In mijn geval gaat het om een (underused) game-pc waar die RTX4070 Super toch al in zat. Maar ik denk dat als ik echt zou moeten beginnen ik eerder naar een DGX Spark of Mac Studio zou gaan kijken. (al vind ik het nog steeds heel duur...)

Met zo'n administrator heb je geen users meer nodig...


  • Ferrox1
  • Registratie: Augustus 2008
  • Laatst online: 16:13
Felicia schreef op maandag 27 juli 2026 @ 14:28:
[...]

Volgens mij zit het verschil voornamelijk in ruwe rekenkracht en geheugen bandbreedte. Kijk hier eens voor een vergelijking tussen een 3090, 4090, 5090 en Mac 5 Pro: YouTube: RTX 3090 vs 4090 vs 5090 vs Mac M5 Max: Qwen3.6-35B-A3B Local AI Benchmark using llama.cpp

Verschillen met lagere RTX kaarten zijn natuurlijk relatief in verhouding tot de geheugenbandbreedte etc.
Ah, dit geeft het wel mooi weer inderdaad. Dankjewel!

Ik mis wel welk verbruik hier tegenover staat en kosten dus op langere termijn? Dat is wat ik een beetje mis in deze video. Alex Ziskind neemt dit wel regelmatig mee in zijn video's en dan zie je echt grote verschillen in tokens/watt. Dan kun je dit ook kwa kosten afzetten tegen een online LLM.

Ook is contextlengte een ding gezien de beperktere geheugen in de RTX-en. Dat is hier ook niet getest. Dus grotere prompts of langere conversaties gaan op een gegeven moment buiten de mogelijkheden vallen, terwijl je met de mac makkelijk naar de 128GB kunt als je dat wil.

Wellicht is mijn toepassing net wat anders. Een AI die op de achtergrond via bijvoorbeeld N8N, Openclaw (of een andere soort) en Home Assistant voor me aan het werk is en ik niet direct mee chat o.i.d. Mogelijk dat ik hem wel ga koppelen in een ontwikkelomgeving, dan is snelheid wel fijn inderdaad, maar daar pak je dan misschien een lichter model voor. Of je gaat dan naar een online abonnement variant voor dat soort toepassingen, om speciaal voor die zeldzame momenten degelijke hardware weg te zetten is overkill in mijn geval.

Kortom, het hangt denk ik ook wel af van je toepassing. En welk middel je dan in wil zetten. Ook privacy telt hier bijvoorbeeld in mee. Wat wil je wel en niet delen met de grote AI boeren.

Een DGX Spark kan ook nog interessant zijn, maar die is dan wel weer prijzig t.o.v. een mac Mini en wellicht dan ook weer overkill voor mijn doel. Bovendien is de Spark wel een niche computer die mogelijk lastiger weer te verkopen is dan een Mac Mini.

het sijpelt er wellicht ook doorheen, Ik kijk ook met een schuin oog naar de businesscase voor zoiets. Het is inderdaad een prijzige hobby en je kunt je euro's maar 1 keer uitgeven. :)

  • Ferrox1
  • Registratie: Augustus 2008
  • Laatst online: 16:13
CSB schreef op maandag 27 juli 2026 @ 15:15:
[...]

In mijn geval gaat het om een (underused) game-pc waar die RTX4070 Super toch al in zat. Maar ik denk dat als ik echt zou moeten beginnen ik eerder naar een DGX Spark of Mac Studio zou gaan kijken. (al vind ik het nog steeds heel duur...)
Kun je dit toelichten? Zie je daar ook dezelfde voordelen van zoals ik die zie?
Pagina: 1 2 3 4 5 Laatste