Ik probeer de omvang van onze website vast te stellen. Dat is vrij lastig, omdat het gaat om ergens tussen de 70.000 en de 150.000 pagina's (niemand weet precies hoeveel) in verschillende systemen - CMS, ouderwetse HTML etc. - met verschillende (sub)domains. Een collega dacht dit al handig te doen via Alltheweb of Google, maar de resultaten die daar uit komen slaan nergens op, wat ook wel te verwachten was, al was het maar omdat ze niet vaak genoeg updaten en niet altijd even goed doorhebben dat verschillende URL's niet altijd verschillende pagina's zijn 
Nu dacht ik handig te zijn, en gewoon zelf een Spider of Web crawler te draaien die vanaf de root alle links afloopt en de structuur opslaat. Daarvoor heb je natuurlijk legio programmaatjes, die meestal bedoeld zijn voor off-line browsing (die dus een hele website leegrippen). Gezien de hoeveelheid pagina's ben ik alleen niet zo blij met het feit dat die meestal alles ook opslaan, al was het maar de HTML
Bijvoorbeeld de JOC Web Spider heeft een net filter - bijvoorbeeld alles door blijven zoeken wat valt onder een *.domein.com, zodat ook systeem1.domein.com en systeem2.domein.com volledig doorzocht worden - maar loopt al na een pagina of 5.000 volledig vast omdat het te veel wordt.
WinWebCrawler leek een goede, die houdt alleen de meta-informatie bij, dat leek ideaal. Alleen die kent weer niet het *.domein.com filter, waardoor na www.domein.com sites als systeem2.domein.com al gezien worden als een aparte site (waarvandaan niet meer verder gezocht wordt, want dat is al een externe site). Die stopte er dus na een pagina of 30.000 weer mee. En alleen ons CMS heeft al meer pagina's dan dat
Ik heb er nog een aantal andere geprobeerd, maar vooralsnog geen gevonden die alle links doorloopt op de manier die ik graag zou willen:
- Filter gebaseerd op domein (dus niet op subdomein), *.domein.com; maar liefst zelfs gewoon een IP range
- Alleen meta-informatie of structuur wordt opgeslagen en in ieder geval niet de volledige HTML
- Hij moet een beetje snel zijn en veel threads tegelijk kunnen laten lopen zonder vast te lopen bij deze omvang
- Liefst freeware of niet functioneel gelimiteerde shareware, want voordat ik het voor elkaar heb dat iemand zijn credit card trekt om zo'n progje te betalen ben ik een paar maanden verder
maar als er echt een goede is, is daar natuurlijk wel geld voor.
Iemand goeie ideëen of ervaringen met crawlers?
Nu dacht ik handig te zijn, en gewoon zelf een Spider of Web crawler te draaien die vanaf de root alle links afloopt en de structuur opslaat. Daarvoor heb je natuurlijk legio programmaatjes, die meestal bedoeld zijn voor off-line browsing (die dus een hele website leegrippen). Gezien de hoeveelheid pagina's ben ik alleen niet zo blij met het feit dat die meestal alles ook opslaan, al was het maar de HTML
Bijvoorbeeld de JOC Web Spider heeft een net filter - bijvoorbeeld alles door blijven zoeken wat valt onder een *.domein.com, zodat ook systeem1.domein.com en systeem2.domein.com volledig doorzocht worden - maar loopt al na een pagina of 5.000 volledig vast omdat het te veel wordt.
WinWebCrawler leek een goede, die houdt alleen de meta-informatie bij, dat leek ideaal. Alleen die kent weer niet het *.domein.com filter, waardoor na www.domein.com sites als systeem2.domein.com al gezien worden als een aparte site (waarvandaan niet meer verder gezocht wordt, want dat is al een externe site). Die stopte er dus na een pagina of 30.000 weer mee. En alleen ons CMS heeft al meer pagina's dan dat
Ik heb er nog een aantal andere geprobeerd, maar vooralsnog geen gevonden die alle links doorloopt op de manier die ik graag zou willen:
- Filter gebaseerd op domein (dus niet op subdomein), *.domein.com; maar liefst zelfs gewoon een IP range
- Alleen meta-informatie of structuur wordt opgeslagen en in ieder geval niet de volledige HTML
- Hij moet een beetje snel zijn en veel threads tegelijk kunnen laten lopen zonder vast te lopen bij deze omvang
- Liefst freeware of niet functioneel gelimiteerde shareware, want voordat ik het voor elkaar heb dat iemand zijn credit card trekt om zo'n progje te betalen ben ik een paar maanden verder
Iemand goeie ideëen of ervaringen met crawlers?
[ Voor 9% gewijzigd door PowerFlower op 11-02-2004 12:42 ]