Over tekstherkenningssoftware OCR gesproken
Wij zijn een groot drukkerijbedrijf in Shenzhen China. Wij bieden alle boekpublicaties, hardcover boekafdrukken, papercover boekdruk, hardcover notitieboek, takboekafdrukken, boekafdrukken met zadelafdruk, boekjes printen, verpakkingsdoos, kalenders, alle soorten PVC, productbrochures, notities, kinderboeken, stickers, allemaal soorten speciale papieren kleurendrukproducten, gamekaart enzovoort.
Bezoek voor meer informatie
http://www.joyful-printing.com. Alleen ENG
http://www.joyful-printing.net
http://www.joyful-printing.org
e-mail: info@joyful-printing.net
De Chinese karakterherkenningssoftware heeft tot taak om te bestuderen hoe je een computer "geletterd" kunt maken. Het systeem gebruikt meestal een apparaat voor foto-elektrische conversie om een Chinees teken of een woordvak om te zetten in een elektrisch signaal en verzendt het naar een computer, die automatisch wordt herkend en gelezen door een computer, dus het wordt optisch genoemd. Optical Character Recognition (OCR).
OCR ontwikkelingsprofiel
Het concept van OCR werd voor het eerst voorgesteld door de Duitse wetenschapper Tausheck in 1929. Later stelde de Amerikaanse wetenschapper Händel ook het idee voor om technologie te gebruiken om woorden te identificeren. Het vroegste onderzoek naar de herkenning van gedrukte Chinese karakters was Casey en Nagy van IBM. In 1966 publiceerden ze het eerste artikel over Chinese tekenherkenning, dat sjabloonafstemming gebruikte om 1000 gedrukte Chinese karakters te identificeren. In het begin van de jaren zeventig begonnen Japanse wetenschappers Chinese karakterherkenning te bestuderen en deden ze veel werk. Het onderzoek naar Chinese karakterherkenning in China begon relatief laat en het onderzoek van OCR begon eind jaren zeventig. De vroege OCR-software kon niet voldoen aan de werkelijke vereisten vanwege verschillende factoren zoals herkenningssnelheid en productisatie. Tegelijkertijd heeft het, als gevolg van de hoge kosten van hardwareapparatuur en de trage werkingssnelheid, geen praktisch niveau bereikt. Slechts enkele afdelingen, zoals informatie-afdelingen, pers en publicatie-eenheden, gebruiken OCR-software. Na 1986 heeft het Chinese OCR-onderzoek grote vooruitgang geboekt en heeft het innovaties doorgevoerd in Chinese karaktermodellering en herkenningsmethoden. Het heeft vruchtbare resultaten opgeleverd in systeemontwikkeling en ontwikkelingstoepassingen. Veel eenheden hebben achtereenvolgens Chinese OCR-producten geïntroduceerd. Na de jaren 1990, met de brede toepassing van platformscanners en de popularisering van informatie-automatisering en kantoorautomatisering in China, is de verdere ontwikkeling van OCR-technologie sterk bevorderd en is de herkenningssnelheid van OCR erkend en is de herkenningssnelheid bevredigend de gebruikers. Claim.
Op dit moment zijn er veel populaire OCR-software. De Engelse OCR omvat voornamelijk OmniPage, Chinese OCR, voornamelijk Tsinghua Unisplendour OCR, Tsinghua Wentong OCR, Hanwang OCR, Zhongjing Shangshu OCR, Danqing OCR en Mengyu OCR. Ondanks de grote hoeveelheid Chinese karakters en complexe lettertypen is de OCR-technologie volwassener geworden. Veel OCR-software kan niet alleen zwart-wit gedrukte Chinese tekens herkennen, maar ook grijswaarden en in kleur geprinte Chinese karakters herkennen. De herkenningssnelheid is snel en de nauwkeurigheid van de herkenningsnauwkeurigheid is meer dan 99%. Het kan verschillende lettertypen herkennen, zoals Song, Bold en Scorpion. Traditional; kan een verscheidenheid aan lettertypen herkennen, verschillende lettertypegroottemixen; sommige OCR-software kan ook afbeeldingen, tabellen identificeren. Tegelijkertijd is er grote vooruitgang geboekt bij de studie van handgeschreven Chinese karakterherkenning, en het correcte herkenningspercentage heeft meer dan 70% bereikt.
OCR-softwareapplicatie
Op de scannermarkt zijn veel typen kantoor- en homoscanners uitgerust met OCR-software. De violette scanner is bijvoorbeeld uitgerust met violet OCR, de kristalscanner is uitgerust met Shangshu OCR en de Mustek-scanner is uitgerust met Danqing OCR. De scanner en de OCR-software delen het hele proces van invoer van het document tot tekstherkenning.
Documentscannen wordt vaak gebruikt op kantoorgebied. Documenten met betrekking tot publicaties in kranten, tijdschriften, enz. Worden door een scanner gescand en vervolgens wordt OCR-identificatie uitgevoerd of opgeslagen als een beeldbestand voor latere OCR-herkenning en worden afbeeldingsbestanden in tekst omgezet. Bestand of Word-bestand voor opslag.
Bovendien is de opslag en overdracht van digitale informatie niet alleen laag in kosten, hoog in efficiëntie, maar ook aanpasbaar aan de onontwikkelde behoeften van zetwerk en netwerkoverdracht. Op dit moment zijn er veel papieren schatten zoals boeken, kranten, tijdschriften enzovoort in China, en het is dringend nodig ze om te zetten in elektronische informatie. De oprichting van een elektronische bibliotheek vereist bijvoorbeeld dat de boeken pagina voor pagina worden gescand en de identificatie van de OCR-software vervangt het handmatig typen van woorden, wat de ingangstijd aanzienlijk verkort, arbeidsintensiteit vermindert, mankracht bespaart en kosten verlaagt. Verbeter de nauwkeurigheid van toegang, werkefficiëntie en moderne kantoorautomatisering.
Op dit moment is de combinatie van OCR-software en scanners toegepast op vele gebieden van het informatietijdperk, zoals digitale bibliotheken, identificatie van verschillende rapporten en identificatie van bank- en belastingstelselstandaarden. Met de ontwikkeling en popularisering van netwerk en informatie wordt de toepassingsomvang ervan steeds uitgebreider.
Samenstelling van het OCR-systeem
De functie van de Chinese herkenningssoftware OCR is om verschillende grafische afbeeldingen of afbeeldingen te herkennen van elk Chinees teken dat in Chinese karakters, afdrukken of handschriften is vastgelegd per computer en om de Chinese karaktercategoriecodes te markeren. Daarom is Chinese karakterherkenning uiteindelijk een probleem met beeldherkenning. Vanwege de grote hoeveelheid Chinese karakters, verschillende lettertypen, lettertypen en complexe structuren, is het proces van Chinese karakterherkenning uiterst gecompliceerd. Schematisch diagram van de OCR-softwarewerkstroom, zoals weergegeven in de volgende tabel:
Documentgegevens → scaninvoer → beeldverwerking → layoutverdeling → tekstherkenning → tekstbewerking → documentopslag
Vanwege de populariteit en de brede toepassing van scanners, hoeft OCR-software alleen een interface met de scanner te bieden en de software voor het scannerstuurprogramma te gebruiken. Daarom is de OCR-software voornamelijk samengesteld uit een beeldverwerkingsmodule, een lay-outverdeelmodule, een tekstherkenningsmodule en een tekstverwerkingsmodule.
1. Beeldverwerkingsmodule
De beeldverwerkingsmodule heeft voornamelijk functies zoals documentscanning, beeldschaling en beeldrotatie. Na invoer door de scanner vormt het document een beeldbestand en kan de beeldverwerkingsmodule het beeld vergroten om vlekken en krassen te verwijderen. Als de afbeelding niet correct is geroteerd, kan de afbeelding handmatig of automatisch worden geroteerd om betere voorwaarden voor tekstherkenning te creëren. De herkenningssnelheid is hoger.
2. Module lay-outverdeling
De lay-outverdelingsmodule bevat hoofdzakelijk lay-outverdeling en wijzigingsdeling, dat wil zeggen begrip van de lay-out, woordsegmentatie, normalisatie, enz., En automatische of handmatige lay-out kan worden geselecteerd. Het doel is om de OCR-software te vertellen om de artikelen, tabellen, enzovoort in dezelfde lay-out te scheiden, zodat ze afzonderlijk en in welke volgorde kunnen worden verwerkt.
3. Tekstherkenningsmodule
De tekstherkenningsmodule is het belangrijkste onderdeel van de OCR-software, een eenvoudig processchema voor tekstherkenning, zoals hieronder weergegeven. De tekstherkenningsmodule voert voornamelijk "lezen" uit op de ingevoerde Chinese tekens, maar het kan geen meerregelige regel zijn en moet regel voor regel worden gesneden. Voor Chinese karakters wordt het meestal herkend door één woord en één woord, dat wil zeggen, enkel woordherkenning, en dan genormaliseerd. De tekstherkenningsmodule extraheert de kenmerken van verschillende Chinese voorbeeldtekens, voltooit de herkenning, vindt automatisch verdachte woorden en heeft functies zoals vóór en na associatie.
Invoer origineel scannen → regelsnijden → woordafsnijden → naturalisatie → extractie functie-extractie → woordherkenning ┐ ┐
└- → Pre-classificatie feature-extractie → Feature-bibliotheek (woordenboek) → Outputmanuscript
4. Tekstbewerkingsmodule
De tekstbewerkingsmodule wijzigt en bewerkt voornamelijk de door OCR herkende tekst. Als het systeem herkent dat het verkeerd is, wordt de tekst vet rood of blauw weergegeven en wordt een vergelijkbare tekst voor selectie weergegeven en selecteert u de editor voor uitvoer.
OCR-software gebruiken
Hoewel er vele soorten OCR-software zijn, is hun gebruik vergelijkbaar. De eerste stap is om het document te scannen en vervolgens OCR-herkenning uit te voeren. Het gebruik van OCR-software is als volgt:
1. Scannen van documenten
Om OCR-software te gebruiken voor tekstherkenning, kunnen documenten rechtstreeks in de OCR-software worden gescand. Na het uitvoeren van de OCR-software verschijnt de OCR-software-interface.
Plaats het document dat moet worden gescand op de glasplaat van de scanner zodat de zijde die moet worden gescand naar de glasplaat van de scanner wijst met het bovenste uiteinde van het document naar beneden gericht, uitgelijnd met de rand van de liniaal en vervolgens de scanner. bedekt om voor te bereiden voor het scannen. Klik op de knop "Scannen" in het venster om de scandriversoftware in te voeren om te scannen. De scanmethode wordt hier niet beschreven. Er moet echter worden opgemerkt dat de resolutie kan worden ingesteld op 200 ~ 400 dpi. Voor tekstdocumenten is het van cruciaal belang om de helderheid aan te passen.
2. OCR-herkenning
Om het bedieningsgemak te vergroten, selecteert u opties in het menu en verschijnen er links van het venster verschillende pictogrammen.
Voor een beter gebruik, introduceer eerst het pictogram aan de linkerkant van het scherm van boven naar beneden:
"Zoom in" -gereedschap: voor vergroting van de afbeelding; "zoom uit" -hulpprogramma: om het beeld te verkleinen; "instellen van het herkenningsgebied" hulpmiddel: voor het instellen van het herkenningsgebied; "De herkenningsvolgorde instellen": voor het instellen van de herkenningsvolgorde; Delete Recognition Area tool: om het herkenningsgebied te verwijderen; "Erase Image Noise" tool: om een gebied in de afbeelding te wissen; "Rotate Image" -gereedschap: om de afbeelding 90 °, 180 ° of 270 ° te roteren; Kantelcorrectietool: voor handmatige correctie van de beeldkanteling.
Algemene stappen voor OCR-identificatie:
(1) Nadat het document is gescand, is de te herkennen tekst in het venster erg klein. Selecteer eerst het hulpmiddel "Inzoomen" om het beeld juist te vergroten om de foto duidelijker te maken. Indien nodig kunt u ook het hulpmiddel "Uitzoomen" selecteren om de grootte van het scherm naar behoren te verkleinen.
(2) Als het scherm 90 °, 180 ° of 270 ° moet worden gedraaid, gebruikt u het gereedschap Beeld roteren om het beeld te draaien. Als het tekstscherm schuin staat, selecteert u het gereedschap Kantelcorrectie om het scherm aan te passen.
(3) Selecteer het gereedschap "Herkenningsgebied instellen" tijdens de herkenning en kadreer het gebied dat moet worden herkend op het tekenscherm. In dit geval kunnen meerdere gebieden worden ingekaderd volgens de schermvoorwaarde. Als het ingelijste gebied niet juist is, kunt u het hulpmiddel Delete Identifying Area gebruiken om het geselecteerde herkende gebied te verwijderen.
(4) Om de herkenningssnelheid te verbeteren, kan het "Erase Image Noise" -gereedschap, als het geselecteerde herkenningsgebied ruis of een onherkenbaar beeld heeft, worden geselecteerd om de ruis bit voor bit te wissen. Als u in delen wilt wissen, kunt u het hulpprogramma Afbeeldingsblok wissen selecteren.
(5) Klik op het pictogram "Herkennen", waarna de OCR-weergave tekstsegmentatie uitvoert en vervolgens overbrengt naar het scherm "Herkennen" en de herkende tekst stap voor stap wordt weergegeven en vervolgens wordt overgebracht naar het venster "Proeflezen van documenten" als getoond.
Veel OCR-software heeft een tekstwijzigingsfunctie die tekst herkent die mogelijk onjuist is, wordt weergegeven in een heldere kleur en kan worden gewijzigd.
(6) Bewaar het herkende bestand als een tekstbestand (TXT) of een Word RTF-bestand.

