Ja, maar dat zou niet nodig moeten zijn voor met name het raster deel. RT is vaak ook nauwelijks beter dan baked lighting kan zijn.sunsmountain schreef op donderdag 9 oktober 2025 @ 01:05:
Eens dat DLSS 4 niet zoveel toevoegt aan DLSS 3.5, maar Ray Reconstruction (zo'n denoiser) is wel nice to have, juist voor die ray tracing workloads om toch net even een wat scherper beeld neer te zitten met minder gerenderde pixels en meer performance. Is dat ook niet het hele idee van upscaling, minder pixels renderen, meer interpoleren?
Ja, dat is wat mist en nee, dat is niet hoe Nvidia het aan pakt. Nvidia's aanpak is vooral meer RT cores er tegenaan gooien zodat ze meer hits kunnen testen, maar daar is het bij gebleven. De enige daadwerkelijke verbetering die er sinds de Turing release in zit is SER, maar dat is een opt-in shader en is vooral een optimalisatie voor scheduling. Werkt ook niet op alle GPU's, als er niet genoeg L2$ beschikbaar is (ten opzichte van het aantal SM's en dus RT cores - ironisch genoeg de 4090 bijvoorbeeld) heeft het geen effect - het kan zelfs nadelig werken en stalls veroorzaken. Ik heb daar een tijd geleden al eens iets over gepost.Wat nu nog teveel op CPU gedaan wordt, is BVH + ray coherence? De ray tracing van RDNA 4 is al stukken beter, en AMD breidt nog steeds de shaders uit voor ray tracing functionaliteit. Lijkt een goede strategie, maar in de RDNA 5 willen ze ray tracing wel sterk verbeteren: hoe dan zonder BVH coherence sorting dedicated hardware? Meer BVH units? Dat is meer de brute force aanpak van Geforce, ook nog steeds niet next level ray tracing, toch?
AMD is sowieso al flexibeler qua scheduling en hun optimalisaties zijn vooral op geheugen (cache, niet VRAM) gebruik gericht geweest, naast meer hits/clock te kunnen doen.
Wat AMD gaat doen weet ik niet, wel durf ik te stellen dat zij in de beste positie zitten om uit te breiden. Qua raster prestaties zijn we al lang voorbij waar meer units iets doet. Dat heb ik ook al vaak zat gezegd, de sweet spot lijkt voor beide tussen de 60 en 80 CU's/SM's te liggen op dat vlak, en rasterisation gaat altijd nodig zijn. Door AMD's architectuur kunnen zij eenvoudiger het huidige ontwerp nemen en dingen toevoegen, omdat ze data beter rond kunnen pompen. Omdat we nog steeds op Turing+ zitten bij Nvidia, moeten zij een veel grotere wijziging doorvoeren. Vergeet niet dat RT alsnog pixel shaders vereist (hits testen is leuk en aardig, maar een pixel moet toch nog een kleurtje krijgen), dus door de manier waarop hun SM's in elkaar steken en hoe hun geheugen hiërarchie werkt zijn ze heel erg beperkt. RT is veel meer een big-picture dingetje dan raster is.
Ze hebben die whitepaper al een paar keer geüpdated, we zitten nu op 3.5: thread coherency sorting, maar dat is gelokaliseerde coherency. Maar dat deed Turing al. SER werkt op Turing ook, heeft enkel geen impact door een gebrek aan cache. Alle generaties er na hebben opt-in optimalisaties toegevoegd, maar geen hardware capabiliteiten. Zelfde geldt voor AMD. We zitten al 7 jaar op level 3, 3.5 komt nu mondjesmaat door omdat het een opt-in dingetje is.
1: "full RT" gaat nog tientallen jaren duren; waarbij "full" ook altijd relatief zal zijn, want je kunt per definitie altijd net iets preciezere resultaten krijgen. RT heeft geen bovenlimiet. "Full" betekent hier "genoeg rays zodat een denoiser niet essentieel is".SG schreef op donderdag 9 oktober 2025 @ 07:18:
Dus de nextstep kan zijn dat vooral RT naar shader verhuist dan krijg je enorme hoeveelheid aan RT compute en dat mogelijk full RT mogelijk kan zijn .
2: Nee, zo werkt dat niet. De schakeling naar unified "shaders" was omdat er steeds meer logica kwam om pixels te kleuren, waarbij er een serie instructies uitgevoerd kon worden die allemaal vrij simpel van aard zijn en voor elke pixel uitgevoerd moeten worden, maar met andere data - dat is waar SIMD voor staat: single instruction, multiple data. RT is complexer en heeft juist wél weer een fixed pipeline nodig (heb ik ook al eerder gezegd). Dat verhuis je niet zomaar naar de FP32 ALU's. Voor RT kun je ook toe met minder ALU's per "test", dus de verhoudingen zijn compleet anders. Alle 3 de fabrikanten gebruiken hun SIMD's ook voor RT, het probleem is dat dat proces elke keer opnieuw uitgevoerd wordt door een gebrek aan coherency.
Enkele ideeën van Larrabee zouden wel nuttig kunnen zijn, maar nee, die aanpak zou ook niet te doen zijn. Zou veel te groot moeten worden.Doet mij denken aan larabee wat mogelijk 8 generaties te vroeg is.
/f/image/nOctv1LngWR6N53CGeQxrgzT.png?f=fotoalbum_large)
:strip_exif()/f/image/OFFRM8qst1NxTrkHY55cldUj.jpg?f=fotoalbum_large)