Ik heb gisteravond even dit artikel over lucene gelezen, leuk artikel hoewel er niet echt ingegaan wordt op hoe het precies werkt.
Maar goed, ik bedacht ineens, waarom zou je je bestanden systeem eigenlijk niet als index gebruiken? Als je een document indexeert maakt hij gewoon een directory structuur aan:
lopen:
/l/o/p/e/n
slapen:
/s/l/a/p/e/n
sluipen:
/s/l/u/i/p/e/n
In die directory staan dan links naar documenten die dat woord matchen. Is dit zo'n raar idee? Zitten er grote nadelen aan? Misschien wordt het bestandensysteem erg belast?
Op zich lijkt het me wel makkelijk indexen maken en zoeken.
Iemand typt "slapen" in, de zoekmachine kijkt in de /s/l/a/p/e/n directory, bestaat hij, dan is het een match, zo niet, dan niet.
Het nadeel is natuurlijk wel dat je ontiegelijk veel directories en subdirectories krijgt. En in hoeverre dat een probleem is kan ik niet echt inschatten.
Ideeën?
Maar goed, ik bedacht ineens, waarom zou je je bestanden systeem eigenlijk niet als index gebruiken? Als je een document indexeert maakt hij gewoon een directory structuur aan:
lopen:
/l/o/p/e/n
slapen:
/s/l/a/p/e/n
sluipen:
/s/l/u/i/p/e/n
In die directory staan dan links naar documenten die dat woord matchen. Is dit zo'n raar idee? Zitten er grote nadelen aan? Misschien wordt het bestandensysteem erg belast?
Op zich lijkt het me wel makkelijk indexen maken en zoeken.
Iemand typt "slapen" in, de zoekmachine kijkt in de /s/l/a/p/e/n directory, bestaat hij, dan is het een match, zo niet, dan niet.
Het nadeel is natuurlijk wel dat je ontiegelijk veel directories en subdirectories krijgt. En in hoeverre dat een probleem is kan ik niet echt inschatten.
Ideeën?