Ik heb het volgende probleem,
Ik wil van een lap tekst het aantal spelfouten hebben. Ik hoef niet te weten welke woorden fout zijn gespeld of wat er bedoeld zou worden, gewoon puur:
Dit is eeen zin met spelvouten.
Moet een integer waarde van 2 opleveren.
Nou dacht ik zelf aan de volgende opties:
Optie 1:
Zelf een algorithme schrijven met behulp van Levenshtein Distance en een woordenlijst.
probleem: ik moet een tekst dan eerst in woorden indelen en per woord door de woordenlijst zoeken, hierdoor wordt teveel tijd gebruikt.
Ik zou natuurlijk ervan uit kunnen gaan dat de eerste letters van een woord goed zijn, dat zou de zoekopties in een binaire search behoorlijk verkleinen. De vraag is of dat bruikbare resultaten oplevert.
Optie 2:
De spellingscontrole van Microsoft Office, OpenOffice o.i.d. gebruiken. Die van Office 97 enzo is via COM aan te sturen, maar kan die ook gewoon het aantal fouten teruggeven? Heeft iemand hier ervaring mee of een verwijzing naar een voorbeeld?
Persoonlijk werk ik het liefst optie 1 uit, zijn er nog dingen waar ik niet aan heb gedacht?
Het doel is om uit het aantal fouten een percentage te berekenen en zodoende teksten te kunnen indelen.
Ik wil van een lap tekst het aantal spelfouten hebben. Ik hoef niet te weten welke woorden fout zijn gespeld of wat er bedoeld zou worden, gewoon puur:
Dit is eeen zin met spelvouten.
Moet een integer waarde van 2 opleveren.
Nou dacht ik zelf aan de volgende opties:
Optie 1:
Zelf een algorithme schrijven met behulp van Levenshtein Distance en een woordenlijst.
probleem: ik moet een tekst dan eerst in woorden indelen en per woord door de woordenlijst zoeken, hierdoor wordt teveel tijd gebruikt.
Ik zou natuurlijk ervan uit kunnen gaan dat de eerste letters van een woord goed zijn, dat zou de zoekopties in een binaire search behoorlijk verkleinen. De vraag is of dat bruikbare resultaten oplevert.
Optie 2:
De spellingscontrole van Microsoft Office, OpenOffice o.i.d. gebruiken. Die van Office 97 enzo is via COM aan te sturen, maar kan die ook gewoon het aantal fouten teruggeven? Heeft iemand hier ervaring mee of een verwijzing naar een voorbeeld?
Persoonlijk werk ik het liefst optie 1 uit, zijn er nog dingen waar ik niet aan heb gedacht?
Het doel is om uit het aantal fouten een percentage te berekenen en zodoende teksten te kunnen indelen.
"If you don't know where you are going, any road will take you there"