Hallo luitjes,
ik ben bezig op mn werk met een nieuwe opdracht, ik moet uitzoeken hoe ik 300.000 oude kranten kan omzetten naar text en dan naar een PDF waarin de OCR text doorzoekbaar is en alleen het plaatje van de gescande krant wordt weergegeven, een zogenaamde PDF Searchable Image.
Nou ik zit ik met de volgende probleempjes. Ik gebruik Finereader maar deze geeft nog steeds veel foutjes in de OCR text. Is het mogelijk om die foutmarge nog verder omlaag te krijgen? Van bv. nu 40% naar 10%? Ik maak al wel trainingsfiles aan maar dat schijnt niet veel te helpen.
Daarnaast moet ik die OCR+image omzetten naar zon PDF, finereader kan alleen standaard PDF's uitpoepen..:-(. Iemand een idee hoe ik zo'n PDF Searchable Image makkelijker kan maken?
ik ben bezig op mn werk met een nieuwe opdracht, ik moet uitzoeken hoe ik 300.000 oude kranten kan omzetten naar text en dan naar een PDF waarin de OCR text doorzoekbaar is en alleen het plaatje van de gescande krant wordt weergegeven, een zogenaamde PDF Searchable Image.
Nou ik zit ik met de volgende probleempjes. Ik gebruik Finereader maar deze geeft nog steeds veel foutjes in de OCR text. Is het mogelijk om die foutmarge nog verder omlaag te krijgen? Van bv. nu 40% naar 10%? Ik maak al wel trainingsfiles aan maar dat schijnt niet veel te helpen.
Daarnaast moet ik die OCR+image omzetten naar zon PDF, finereader kan alleen standaard PDF's uitpoepen..:-(. Iemand een idee hoe ik zo'n PDF Searchable Image makkelijker kan maken?
We are all accidents waiting to happen