[PDF/TXT] Index- en zoekinterface gezocht *

Pagina: 1
Acties:
  • 141 views sinds 30-01-2008
  • Reageer

  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Ik zit hier met de volgende situatie, men wou bij ons de post en overige documenten in laten scannen en op een server uitlaten spugen in pdf formaat. Dit werkt nu prima
met behulp van Omnipage 14 pro office. enkel moet het nu nog geordent worden op
een of andere manier. ik heb het nu zo voor elkaar dat elk document dat wordt ingescanned in een timestamped folder geplaatst word in pdf formaat en een keer in een plain text file ( .txt ).

Is er misschien software beschikbaar die de alle folders doorscanned op de fileserver en de pdfs in een database gooien waar als comment de txt file wordt gebruikt zodat de database makelijk te doorzoeken is voor als men is wil terugkijken in de post van een maand terug.

of als iemand een betere oplossing weet ^^

  • Spider.007
  • Registratie: December 2000
  • Niet online

Spider.007

* Tetragrammaton

Ik plaats in je topictitel even erbij dat het hier om PDF of TXT bestanden gaat :) Kan de standaard windows zoeken interface niet gewoon in TXT files zoeken?

[Gezocht] Search & Index software > [b][PDF/TXT] Index- en zoekinterface gezocht *

---
Prozium - The great nepenthe. Opiate of our masses. Glue of our great society. Salve and salvation, it has delivered us from pathos, from sorrow, the deepest chasms of melancholy and hate


  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Kan hij wel ja, enkel het indexeren niet ^^, ik zat er ook eerst aan te denken gewoon windows search te laten gebruiken, enkel willen ze me niet met die oplossing aan zien komen.

  • NijntjeRocks
  • Registratie: November 2001
  • Laatst online: 21-05 16:51

NijntjeRocks

Jeugdsentiment

De tekst die ingescanned word, is dat echte tekst of pixelgebaseerd?
Als het eerste van toepassing is, is het mss. een idee om Adobe Catalog te gebruiken. Die werd voorheen (tot Acrobat versie 5.0.1 mac) meegeleverd. Bij latere en pc-versies kon je het handmatig (gratis) downloaden van de site.

*Catalog op google*

/edit: ik zie dat er in Acrobat 6.0 Pro een catalogi-functie is ingebouwd, maar daarvoor moet je eerst elke pdf indexeren. Geen idee of het hetzelfde is als Catalog, maar het zal er ws. op gebaseerd zijn..

Dick Bruna? Copyright? Nooit van gehoord!


  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
De pdf files bevaten gewoon de ingeschande pages, images dus. dus heb enkel de
bijgeleverde txt file(S) om door te scannen voor inhoud.

ik zal alsnog effe een kijkje nemen naar catalog, misschien dat ik zo op andere ideeen
kan komen, maar als nog als men iets weet of andere idee hebt hoor ik die graag

  • NijntjeRocks
  • Registratie: November 2001
  • Laatst online: 21-05 16:51

NijntjeRocks

Jeugdsentiment

Apolloc schreef op 03 augustus 2004 @ 11:24:
De pdf files bevaten gewoon de ingeschande pages, images dus. dus heb enkel de
bijgeleverde txt file(S) om door te scannen voor inhoud
Opzich wel jammer, mss. is Capture een idee om de image om te zetten naar tekst, maar dan krijg je wel behoorlijk wat bewerkingen in totaal voordat je een doorzoekbare database hebt :/ .

Dick Bruna? Copyright? Nooit van gehoord!


Verwijderd

Verity
dtSearch

of neem contact op voor een goede oplossing voor Document Management :)
Wij hebben een serverside oplossing, registreert je document (pdf, .doc, .tif of wat dan ook) indien nodig wordt op de server de PDF gemaakt, en op de server wordt er geindexeerd met behulp van dtSearch. Vervolgens kan je via diverse mogelijkheden zoeken in je documenten. Eventueel te koppelen aan compleet Document Management-, Workflowmanagement-, en Postregistratie systeem (en nog veel meer).

[ Voor 69% gewijzigd door Verwijderd op 03-08-2004 12:05 ]


  • F_J_K
  • Registratie: Juni 2001
  • Niet online

F_J_K

Moderator CSA/PB/AI

Front verplichte underscores

dtSearch O+

Maar jij vraagt wat maatwerk als ik het goed begrijp: zoeken in de textfiles en de PDF teruggeven als resultaat, toch? Lijkt me geen standaardoplossing.

'Multiple exclamation marks,' he went on, shaking his head, 'are a sure sign of a diseased mind' (Terry Pratchett, Eric)


Verwijderd

F_J_K schreef op 03 augustus 2004 @ 12:21:
dtSearch O+

Maar jij vraagt wat maatwerk als ik het goed begrijp: zoeken in de textfiles en de PDF teruggeven als resultaat, toch? Lijkt me geen standaardoplossing.
ja, ik snap het nut van de losse textfiles niet zo in jouw situatie (kan wel nut hebben op zich), maar een tool als dtSearch kan gewoon PDF/TEXT bestanden indexeren.

  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
de PDF bevat dus geen text maar een image van het gescande document, vandaar de losse txt file, die kan makelijk voor de content doorgescanned worden. Zal vanmiddag is een poging wagen om het gene wat ik wil in PHP voor elkaar te krijgen, moet eigenlijk in zijn geheel niet moeilijk zijn.

  • F_J_K
  • Registratie: Juni 2001
  • Niet online

F_J_K

Moderator CSA/PB/AI

Front verplichte underscores

Verwijderd schreef op 03 augustus 2004 @ 12:24:
ja, ik snap het nut van de losse textfiles niet zo in jouw situatie (kan wel nut hebben op zich), maar een tool als dtSearch kan gewoon PDF/TEXT bestanden indexeren.
In dit geval niet omdat de PDF's geen tekst maar plaatjes bevatten. dtSearch is niet zo goed in OCR :P

'Multiple exclamation marks,' he went on, shaking his head, 'are a sure sign of a diseased mind' (Terry Pratchett, Eric)


Verwijderd

Apolloc schreef op 03 augustus 2004 @ 12:31:
de PDF bevat dus geen text maar een image van het gescande document, vandaar de losse txt file, die kan makelijk voor de content doorgescanned worden. Zal vanmiddag is een poging wagen om het gene wat ik wil in PHP voor elkaar te krijgen, moet eigenlijk in zijn geheel niet moeilijk zijn.
Tsja, pak Abby die kan PDF/TEKST documenten aanmaken, heeft ook een zeer goede OCR engine. Kan je met die Omnipage geen pdf/tekst uitspugen?

[edit]
Ja, OmniPage kan zelf PDF/Tekst aanmaken zie:
http://www.scansoft.com/omnipage/features.asp#pdf
. OmniPage Pro 14 Office supports the creation of searchable PDF files

[ Voor 16% gewijzigd door Verwijderd op 03-08-2004 13:21 ]


  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Omnipage kan inderdaad de scans opzetten naar PDF/TXT enkel is dit geen optie gezien officele dokumenten zoals kontraken niet bewerkbaar mogen zijn. Alles moet dus als orgineel ingescanned zijn. Vandaar dus ook het extra tekst dokument, die
is dus wel door omnipage ge-ocr-ed en als tekstfile weggeschreven zodat ik die kan gebreuken om alsnog naar de inhoud van de pdf bestanden te zoeken.

[ Voor 46% gewijzigd door Apolloc op 03-08-2004 17:34 ]


Verwijderd

Apolloc schreef op 03 augustus 2004 @ 17:32:
Omnipage kan inderdaad de scans opzetten naar PDF/TXT enkel is dit geen optie gezien officele dokumenten zoals kontraken niet bewerkbaar mogen zijn.
Daar zijn toch wel andere oplossingen voor te vinden, bovendien pdf tekst is niet zomaar te bewerken (dacht ik toch), het houdt alleen in dat de tekst (in jouw geval, de ge-ocr'de tekst) bij de pdf ingesloten zit, om zo te kunnen zoeken en eventueel tekst te kunnen kopieeren, je kan niet zomaar ff de tekst in die pdf aanpassen.

Maar ik weet dat Verity wel overweg kan met losse tekstbestanden en daarbij behorende images en/of pdf bestanden, of dtSearch dit kan weet ik zo 123 even niet (kan ik wel nagaan).

[ Voor 15% gewijzigd door Verwijderd op 03-08-2004 17:38 ]


  • lordgandalf
  • Registratie: Februari 2002
  • Laatst online: 28-08 15:48
kun je niet een mysql db maken waarin je een veld maakt met de text van de pdf en in een tweede veld het pdf bestand als binary ?
moet je nog wel een manier vinden ze er in te krijgen maar dan kun je volgens mij gewoon het text veld doorzoeken naar bepaalde tekst en dan het id opvragen en daarmee de pdf terug geven die aan de tekst gekoppeld is.?

Steam: Profile / Socialclub: Profile / Uplay: minedwarf / Origin: lordgandalf3


Verwijderd

lordgandalf schreef op 03 augustus 2004 @ 17:41:
kun je niet een mysql db maken waarin je een veld maakt met de text van de pdf en in een tweede veld het pdf bestand als binary ?
moet je nog wel een manier vinden ze er in te krijgen maar dan kun je volgens mij gewoon het text veld doorzoeken naar bepaalde tekst en dan het id opvragen en daarmee de pdf terug geven die aan de tekst gekoppeld is.?
Zoeken in tekst is nogal wat anders dan ff zoeken op een tekstveldje in MySql (of welke db dan ook). Indien het aantal bestanden flink gaat groeien, kan je beter een tool als dtSearch of Verity (of een andere tekst index/search tool) gebruiken.

  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Ik heb het nu zover dat me webserver vanaf een start directory alle bovenligende directory's afscanned naar pdf bestanden en de daarbij behorende txt bestanden. Als ik de path info nu opsla in een database en de txt bestanden ga doorscannen naar veel voorkomende woorden ( de, het & een etc natuurlijk gefiltert ) kan ik deze weglaten schrijven in de database als trefwoorden samen met andere woorden die ik van te voren al als trefwoord heb aanbevolen ( zoals bijvoorbeeld bedrijfsnamen ).

Dit moet opzich goed te doen zijn denk ik zo. betwijfel nu dat ik een programma op maat zal vindenen de aanbevolen programma's lijken mij een beetje een dure overkill.

Verwijderd

Apolloc schreef op 04 augustus 2004 @ 09:24:
Ik heb het nu zover dat me webserver vanaf een start directory alle bovenligende directory's afscanned naar pdf bestanden en de daarbij behorende txt bestanden. Als ik de path info nu opsla in een database en de txt bestanden ga doorscannen naar veel voorkomende woorden ( de, het & een etc natuurlijk gefiltert ) kan ik deze weglaten schrijven in de database als trefwoorden samen met andere woorden die ik van te voren al als trefwoord heb aanbevolen ( zoals bijvoorbeeld bedrijfsnamen ).

Dit moet opzich goed te doen zijn denk ik zo. betwijfel nu dat ik een programma op maat zal vindenen de aanbevolen programma's lijken mij een beetje een dure overkill.
tsja, als je persé zelf aan de slag wilt .... ( ik denk dat je jezelf gaat tegenkomen ).
Gaat het eigenlijk om een grote administratie (aantallen poststukken etc??).


/me Vraagt zich af waarom er nog zoveel "gehobby'd" wordt om problemen in bedrijfsprocessen (lees administratie & archivering) in dit geval op te lossen, wanneer begint het nederlandse bedrijfsleven met het hobby'en aan hun wagenpark en huisvesting ?

[ Voor 7% gewijzigd door Verwijderd op 04-08-2004 09:54 ]


  • bruto
  • Registratie: Juni 2001
  • Laatst online: 13-07 15:44

bruto

Druktemaker.

Wij doen exact dat wat jij wilt, maar dan nog veel meer. Als je serieus geintresseerd bent (lees: je hebt er budget voor) in documentbeheer, dan graag een mailtje, vertel je er graag meer over :)

The more you know, the more you know you don't know.


Verwijderd

Ja, als je er budget voor heb kan je ook wel ff naar mij mailen ...........

[ Voor 214% gewijzigd door Verwijderd op 04-08-2004 12:12 ]


  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Het gaat voor een redelijk grote administratie, ik denk dat er zeer zeker meer dan
15.000 documenten ingescannend moeten gaan worden en daarna gewoon alles wat er per dag binnenkomt aan post.

Het is voor een bedrijf in Oost-Duitsland waar ik op dit moment werk en woon dus kan engels talige software meteen aan de kant schijven gezien ze hier enkel en alleen Duits spreken.

Verwijderd

Apolloc schreef op 04 augustus 2004 @ 13:31:
Het gaat voor een redelijk grote administratie, ik denk dat er zeer zeker meer dan
15.000 documenten ingescannend moeten gaan worden en daarna gewoon alles wat er per dag binnenkomt aan post.

Het is voor een bedrijf in Oost-Duitsland waar ik op dit moment werk en woon dus kan engels talige software meteen aan de kant schijven gezien ze hier enkel en alleen Duits spreken.
En wat komt er per dag binnen aan (post)stukken en/of andere documenten?

  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Inkomende post zal niet zoveel zijn van wat ik totnu toe gezien heb, denk zo
max 10 documenten per dag derbij voorlopig.

  • Apolloc
  • Registratie: Maart 2002
  • Laatst online: 10-02 22:09
Nou ik hebt voor elkaar en draait als een trein tot nu toe, php script checked om de
zeveel gegeven tijd de start directory of er nieuwe folders bijgekomen zijn, zoja worden deze gescanned naar de inhoud. Het tekst bestand wat bijgelevert is sloopt hij uit elkaar en scanned die voor trefwoorden als deze gevonden worden worden die in de database gezet, vindt hij ze niet dan neemt hij als trefwoord de eerste 8 woorden die het meest voorkomen op natuurlijk woorden zoals de, het & een etc na.

en nu alle info in de database staat is het een eitje op een zoek optie ervoor te maken ^^

Verwijderd

Apolloc schreef op 05 augustus 2004 @ 08:49:
Nou ik hebt voor elkaar en draait als een trein tot nu toe, php script checked om de
zeveel gegeven tijd de start directory of er nieuwe folders bijgekomen zijn, zoja worden deze gescanned naar de inhoud. Het tekst bestand wat bijgelevert is sloopt hij uit elkaar en scanned die voor trefwoorden als deze gevonden worden worden die in de database gezet, vindt hij ze niet dan neemt hij als trefwoord de eerste 8 woorden die het meest voorkomen op natuurlijk woorden zoals de, het & een etc na.

en nu alle info in de database staat is het een eitje op een zoek optie ervoor te maken ^^
:) Ik zou zeggen stuur een briefje naar Verity, dtSearch dat je iets simpels hebt gevonden om tekst te indexeren en te zoeken :)

Nee, als dit voor jouw voldoet is het prachtig, echter nu wil ik zoeken op 3 trefwoorden die achter elkaar moeten staan, hoe ga je dat oplossen?

  • F_J_K
  • Registratie: Juni 2001
  • Niet online

F_J_K

Moderator CSA/PB/AI

Front verplichte underscores

offtopic:
maui71: natuurlijk zijn er veel uitgebreidere oplossingen mogelijk, maar je vertelt ook niet in ieder topic in P&W dat er al kant&klare producten bestaan die het beter kunnen en in WOS dat je er ook een pro bij kunt halen. En een deel van Fotografie kan ook worden opgeheven want op www.worldpressphoto.nl staan toch wel mooiere foto's ;)

'Multiple exclamation marks,' he went on, shaking his head, 'are a sure sign of a diseased mind' (Terry Pratchett, Eric)


Verwijderd

F_J_K schreef op 05 augustus 2004 @ 12:18:
offtopic:
maui71: natuurlijk zijn er veel uitgebreidere oplossingen mogelijk, maar je vertelt ook niet in ieder topic in P&W dat er al kant&klare producten bestaan die het beter kunnen en in WOS dat je er ook een pro bij kunt halen. En een deel van Fotografie kan ook worden opgeheven want op www.worldpressphoto.nl staan toch wel mooiere foto's ;)
Vandaar ook de smilies.

Ik wil TS er alleen op wijzen dat niks zo irritant kan zijn dat een document op den duur niet meer gevonden kan worden en/of dat het document alleen te vinden is tussen een hele grote lijst vanwege het groot aantal hits vanwege beperkte zoek functionaliteit.
(ons motto is dan ook: Zoeken is Vinden)
Echter als TS tevreden is met z'n eigen oplossingen is dat alleen maar mooi natuurlijk. (ok, ik liet me wat meeslepen omdat deze problematiek in ons (lees bedrijf waar ik werk) vakgebied zit )
Pagina: 1