"Doubt—the concern that my views may not be entirely correct—is the true friend of wisdom and (along with empathy, to which it’s related) the greatest enemy of polarization." -- David Blankenhorn
eheijnen schreef op donderdag 27 augustus 2026 @ 09:35:
[...]
Schijnt toch niet allemaal kommer en kwel te zijn:
https://www.bbc.co.uk/news/articles/cjwg5n7y68xo
Ik zie niet hoe dat helpt met de meldingen van beveiligingsproblemen (aldus de LLM) die ik in m'n e-mail ontvang. Nogmaals: Open Source, dus iedereen in de wereld kan LLMs loslaten op onze code (en dat gebeurt dus ook). Soms zitten er waardevolle dingen tussen, soms wat minder, maar om dat te extraheren uit de "vulnerability report" die door LLMs gegenereerd wordt is best een uitdaging vanwege de vaak vrij onduidelijke beschrijving.Kalentum schreef op donderdag 27 augustus 2026 @ 09:38:
[...]
Je kan het taalgebruik wel een beetje sturen door project level instructies mee te geven.
Ja, best wat ervaring ondertussen. We hadden een externe (menselijke) audit tegelijkertijd met wat security issues die binnenkwamen op basis van LLM-bevindingen. Beide vonden toch grotendeels andere dingen. Overigens zit er veel verschil tussen de kwaliteit van de LLM-bevindingen, en bij ons zit er dus nog een laag tussen met een mens die de e-mail naar ons opstelt (en hopelijk ook ziet als iets nergens op slaat), maar ik ben vaak ook wel een aantal uur bezig om erachter te komen wat het probleem nou daadwerkelijk is (en of het een probleem is, en of het impact heeft). Wel minder regels code (weliswaar in Rust, ik denk dat de Java-variant drie keer zo lang zou zijnDaFeliX schreef op donderdag 27 augustus 2026 @ 10:42:
[...]
Ik heb met behulp van LLM's wel een aantal beveiligingsproblemen gevonden in oude code (~ 350.000 regels code). Deze waren vrijwel onmogelijk te misbruiken, maar toch vond ik het fijn om ze gevonden te hebben en te fixen. Maar ondanks dat ik nu meerdere modellen op dezelfde codebase heb losgelaten, heb ik het idee dat toch niet elk probleem is gevonden.
ZIjn er mensen met ervaring hier?
Het liefst draai ik het model lokaal, zodat ik het lekker kan laten churnen zonder mij druk te maken over de kosten van een 'analyze'. Tot nu toe heb ik echter Copilot en Claude gebruikt.
Ik stuur dan bijvoorbeeld heel erg aan op het vinden van 1 specifiek probleem ("spoor SQL injection op") ipv "zoek alle security issues". De laatste keer dat ik dit deed kreeg ik een lijst van ~ 20 bevindingen, waarvan 1 legitiem en de rest kul was. Het heeft mij wel een dag gekost om de 20 bevindingen te triageren, dus heb niet zoveel zin om dezelfde exercitie weer te doen als daar hetzelfde resultaat uit gaat komen. Ik heb nu dus een beetje het idee dat ik hier niet meer veel uit kan halen, zonder dat ik echt iets anders ga proberen.
🠕 This side up
Ja wat OT, maar wel interessant, imo.Koenvh schreef op donderdag 27 augustus 2026 @ 19:25:
maar om dat te extraheren uit de "vulnerability report" die door LLMs gegenereerd wordt is best een uitdaging vanwege de vaak vrij onduidelijke beschrijving.
En als je dat extraheren ook nog eens door de llm laat doen?
Vaak loont om de llm het antwoord beter te laten formuleren...
Wie du mir, so ich dir.
Een onduidelijke vraag/verhaal leidt vaak tot een onduidelijk (en onjuist) antwoord. En dat heeft niks met LLMs te maken.eheijnen schreef op donderdag 27 augustus 2026 @ 19:49:
[...]
Ja wat OT, maar wel interessant, imo.
En als je dat extraheren ook nog eens door de llm laat doen?
Vaak loont om de llm het antwoord beter te laten formuleren...
Bovendien is de oplossing veel simpeler: De rapporten die aangeleverd worden moeten duidelijk zijn.
"Doubt—the concern that my views may not be entirely correct—is the true friend of wisdom and (along with empathy, to which it’s related) the greatest enemy of polarization." -- David Blankenhorn
Let op:
Dit topic is niet de plaats om te lopen helpdesken. De Coffee Corner is primair bedoeld als uitlaatklep voor iedereen in de Devschuur® en niet als vraagbaak.
Dit topic is niet de plaats om te lopen helpdesken. De Coffee Corner is primair bedoeld als uitlaatklep voor iedereen in de Devschuur® en niet als vraagbaak.