Rozprávanie o softvéri na rozpoznávanie textu OCR
Sme veľká tlačiarenská spoločnosť v Shenzhen Číne. Ponúkame všetky knižné publikácie, tlač kníh v tvrdých väzbách, potlač kníh v papierovej, papierovej, papierovej forme, notebook, tlač kníh, tlač kníh, tlač kníh, tlač brožúr, balenie krabíc, kalendáre, všetky druhy PVC, brožúry, poznámky, detské knihy, samolepky, všetko druhy špeciálnych papierových tlačiarenských výrobkov, hracích kariet a tak ďalej.
Viac informácií nájdete na stránke
http://www.joyful-printing.com. Len ENG
http://www.joyful-printing.net
http://www.joyful-printing.org
email: info@joyful-printing.net
Úlohou čínskeho softvéru na rozpoznávanie znakov je študovať, ako urobiť počítač "gramotný". Systém zvyčajne používa fotoelektrické zariadenie na konverziu čínskeho znaku alebo slovného poľa na elektrický signál a odosiela ho do počítača, ktorý je automaticky rozpoznávaný a čítaný počítačom, takže sa nazýva optický. Optické rozpoznávanie znakov (OCR).
Profil vývoja OCR
Koncepcia OCR bola prvýkrát navrhnutá nemeckým vedcom Tausheckom v roku 1929. Neskôr americký vedec Handel tiež navrhol myšlienku využitia technológie na identifikáciu slov. Najstarším výskumom v oblasti rozpoznávania tlačených čínskych znakov boli Casey a Nagy z IBM. V roku 1966 vydali prvý článok o rozpoznávaní čínskych znakov, ktorý použil šablónu na identifikáciu 1000 vytlačených čínskych znakov. Začiatkom 70-tych rokov začali japonskí učenci študovať čínske rozpoznávanie znakov a vykonali veľa práce. Výskum v oblasti rozpoznávania čínskych znakov v Číne začal pomerne neskoro a výskumná práca OCR začala v neskorých 70-tych rokoch. Skorý softvér OCR nesplnil skutočné požiadavky kvôli rôznym faktorom, ako je rýchlosť rozpoznávania a produktivita. Súčasne, vzhľadom na vysoké náklady na hardvérové vybavenie a pomalú prevádzkovú rýchlosť, nedosiahla praktickú úroveň. OCR softvér používajú len niektoré oddelenia, napríklad informačné oddelenia, tlačové a publikačné oddelenia. Po roku 1986 dosiahol čínsky výskum OCR veľký pokrok a urobil inovácie v čínskych metódach modelovania a rozpoznávania. Dosiahol plodné výsledky vo vývoji a vývoji aplikácií. Mnohé jednotky postupne spustili čínske produkty OCR. Po deväťdesiatych rokoch minulého storočia, so širokým uplatnením skenerov platforiem a popularizáciou informačnej automatizácie a automatizácie kancelárskych priestorov v Číne, bol značne podporovaný ďalší rozvoj technológie OCR a bola rozpoznaná rýchlosť rozpoznávania OCR a rýchlosť rozpoznávania bola splnená užívateľov. Reklamácie.
V súčasnej dobe existuje mnoho populárnych OCR softvér. Anglický OCR zahŕňa predovšetkým OmniPage, čínsky OCR, hlavne Tsinghua Unisplendour OCR, OCR Tsinghua Wentong, OCR Hanwang, OCR Zhongjing Shangshu, OCR Danqing a OCR Mengyu. Napriek veľkému množstvu čínskych znakov a zložitých fontov technológia OCR dozrela. Veľa softvéru OCR dokáže nielen rozpoznať čiernobiele tlačené čínske znaky, ale tiež rozpoznať čínske znaky v odtieňoch sivej a farebnej tlače. Rýchlosť rozpoznávania je rýchla a presnosť rozpoznávania je vyššia ako 99%. Dokáže rozpoznať rôzne fonty ako Song, Bold a Scorpion. tradičné; dokáže rozpoznať rôzne fonty, rôzne veľkosti písma; niektorý softvér OCR môže tiež identifikovať obrázky, tabuľky. Zároveň sa dosiahol veľký pokrok v štúdii ručného rozpoznávania čínskych znakov a správna miera uznania dosiahla viac ako 70%.
Softvérová aplikácia OCR
Na trhu skenerov sú mnohé typy kancelárskych a domácich skenerov vybavené softvérom OCR. Napríklad fialový skener je vybavený fialovým OCR, skener je vybavený Shangshu OCR a skener Mustek je vybavený OCR Danqing. Skener a softvér OCR zdieľajú celý proces od vstupu dokumentu až po rozpoznanie textu.
Skenovanie dokumentov sa často používa v kancelárii. Dokumenty súvisiace s publikáciami v novinách, časopisoch atď. Sa skenujú skenerom a potom sa vykoná identifikácia OCR alebo sa uloží ako súbor s obrázkom, aby sa neskôr rozpoznalo OCR, a obrazové súbory sa konvertujú na text. Súbor alebo súbor Wordu na ukladanie.
Okrem toho, skladovanie a prenos digitálnych informácií nie je len nízka, má vysokú efektívnosť, ale je tiež prispôsobiteľná nevyvinutým potrebám sadzieb a sieťového prenosu. V súčasnosti je v Číne veľa pokladov, ako sú knihy, noviny, časopisy a tak ďalej, a je naliehavé ich previesť na elektronické informácie. Napríklad zriadenie elektronickej knižnice vyžaduje, aby sa knihy naskenovali po stranách a identifikácia softvéru OCR nahrádza ručné písanie slov, čo značne skracuje vstupný čas, znižuje intenzitu práce, šetrí pracovnú silu a znižuje náklady. Zlepšite presnosť vstupu, efektivitu práce a modernú kancelársku automatizáciu.
V súčasnosti je kombinácia OCR softvéru a skenerov aplikovaná v mnohých oblastiach informačného veku, ako sú digitálne knižnice, identifikácia rôznych reportov a identifikácia štandardov bankového a daňového systému. S rozvojom a popularizáciou siete a informácií bude rozsah jej aplikácie čoraz rozsiahlejší.
Zloženie systému OCR
Funkciou čínskeho softvéru na rozpoznávanie znakov OCR je rozpoznať rôzne grafiky alebo obrazy každého čínskeho znaku zaznamenaného v čínskych znakoch, výtlačkoch alebo rukopisoch počítačom a označiť kódy čínskej kategórie znakov. Preto je rozpoznávanie čínskych znakov v konečnom dôsledku problémom rozpoznávania obrazu. Vzhľadom k veľkému množstvu čínskych znakov, rôznym typom písma, fontom a zložitým štruktúram je proces čínskeho rozpoznávania znakov mimoriadne zložitý. Schéma pracovného postupu softvéru OCR, ako je znázornené v nasledujúcej tabuľke:
Údaje dokumentu → vstup skenovania → spracovanie obrazu → rozdelenie rozloženia → rozpoznávanie textu → úprava textu → ukladanie dokumentov
Kvôli popularite a širokej aplikácii skenerov musí softvér OCR poskytovať iba rozhranie so skenerom a používať softvér ovládača skenera. Preto je softvér OCR tvorený hlavne modulom na spracovanie obrazu, modulom rozdelenia rozloženia, modulom rozpoznávania textu a modulom na úpravu textu.
1. Modul spracovania obrazu
Modul spracovania obrazu má hlavne funkcie, ako je skenovanie dokumentov, škálovanie obrázkov a rotácia obrazu. Po vložení skenerom dokument vytvorí súbor s obrázkom a modul na spracovanie obrazu môže zväčšiť obrázok, aby sa odstránili škvrny a škrabance. Ak sa obrázok neotáča správne, obrázok sa môže otáčať manuálne alebo automaticky, aby sa vytvorili lepšie podmienky na rozpoznanie textu. Miera uznania je vyššia.
2. Modul rozdelenia rozloženia
Modul rozdelenia rozloženia zahŕňa hlavne rozdelenie rozloženia a zmenu rozdelenia, tj pochopenie rozloženia, segmentáciu slov, normalizáciu atď. A možno zvoliť automatické alebo manuálne rozloženie. Účelom je oznámiť OCR softvér, aby oddelil články, tabuľky atď. V rovnakom usporiadaní, aby mohli byť spracované samostatne av akom poradí.
3. Modul rozpoznávania textu
Modul rozpoznávania textu je základnou časťou softvéru OCR, jednoduchého diagramu procesu rozpoznávania textu, ako je znázornené nižšie. Modul na rozpoznávanie textu vykonáva hlavne "čítanie" na vstupných čínskych znakoch, ale nemôže byť viacriadkový a musí byť odrezaný po riadkoch. Pre čínske znaky sa zvyčajne rozpoznáva jedným slovom a jedným slovom, tj rozpoznaním jedného slova a potom normalizovaným. Modul rozpoznávania textu extrahuje funkcie rôznych vzorov čínskych znakov, dokončí rozpoznávanie, automaticky nájde podozrivé slová a má funkcie ako pred a po asociácii.
Skenovanie vstupného originálu → rezanie riadkov → rezanie slov → naturalizácia → extrakcia rozpoznávacích znakov → rozpoznávanie slov ┐ ┐
└- → Extrahovanie predradených funkcií → Knižnica funkcií (slovník) → Výstupný rukopis
4. Modul na úpravu textu
Modul na úpravu textu modifikuje a edituje rozpoznaný text OCR. Ak systém rozpozná, že je nesprávny, text sa zobrazí tučným písmom červenej alebo modrej a poskytne podobný text na výber a vyberte editor pre výstup.
Ako používať softvér OCR
Hoci existuje mnoho typov softvéru OCR, ich použitie je podobné. Prvým krokom je skenovanie dokumentu a následné rozpoznanie OCR. Používanie softvéru OCR je nasledovné:
1. Skenovanie dokumentov
Aby ste mohli používať softvér OCR na rozpoznávanie textu, dokumenty je možné skenovať priamo v softvéri OCR. Po spustení softvéru OCR sa zobrazí rozhranie OCR.
Skenovaný dokument umiestnite na sklenenú stranu skenera tak, aby strana, ktorá sa má skenovať, smerovala k sklenenej strane skenera tak, aby horný koniec dokumentu smeroval nadol, zarovnaný s okrajom pravítka a potom skener je na prípravu na skenovanie. Kliknutím na tlačidlo "Skenovať" v okne zadajte softvér ovládača skenovania na skenovanie. Spôsob skenovania tu nebude opísaný. Treba však poznamenať, že rozlíšenie je možné nastaviť na 200 ~ 400 dpi. Pre textové dokumenty je dôležité nastaviť jas.
2. Rozpoznávanie OCR
Pre jednoduchosť ovládania vyberte možnosti z menu a na ľavej strane okna sa zobrazia rôzne ikony.
Pre lepšie využitie najprv vložte ikonu vľavo od obrazovky zhora nadol:
Nástroj „Priblížiť“: na zväčšenie obrazu; nástroj „oddialiť“: na zmenšenie obrazu; "nastavenie oblasti rozpoznávania": na nastavenie oblasti rozpoznávania; "nastavenie príkazu na rozpoznávanie": na nastavenie poradia rozpoznávania; Nástroj Vymazať oblasť rozpoznávania: na vymazanie oblasti rozpoznávania; Nástroj "Vymazať šum obrazu": na vymazanie oblasti v obraze; Nástroj "Otočiť obrázok": otočenie obrazu o 90 °, 180 ° alebo 270 °; Korekcia náklonu: Pre manuálnu korekciu naklonenia obrazu.
Všeobecné kroky na identifikáciu OCR:
(1) Po naskenovaní dokumentu je rozpoznaný text, ktorý sa zobrazí v okne, veľmi malý. Najprv vyberte nástroj „Priblížiť“, aby sa obrázok správne zväčšil, aby bol obraz jasnejší. Ak je to potrebné, môžete tiež vybrať nástroj „oddialiť“, aby sa veľkosť obrazovky primerane zmenšila.
(2) Ak je potrebné obrazovku otočiť o 90 °, 180 ° alebo 270 °, použite nástroj Rotate Image na otočenie obrázka. Ak je textová obrazovka naklonená, vyberte nástroj korekcie náklonu a upravte obrazovku.
(3) Počas rozpoznávania vyberte nástroj "Nastaviť oblasť rozpoznávania" a oblasť, ktorá sa má rozpoznať, vytvorte rámček na obrazovke znakov. V tomto prípade je možné orámovať viacero oblastí podľa stavu obrazovky. Ak je orámovaná oblasť nesprávna, môžete na odstránenie vybratej rozpoznanej oblasti použiť nástroj Odstrániť identifikačnú oblasť.
(4) Aby sa zlepšila miera rozpoznávania, ak má vybraná oblasť rozpoznávania šum alebo nerozpoznateľný obraz, môže sa vybrať nástroj "Vymazať obrazový šum" na vymazanie šumu bit po bite. Ak potrebujete vymazať kúsky, môžete vybrať nástroj Vymazať blokovanie obrázkov.
(5) Kliknite na ikonu „Recognize“, potom displej OCR vykonáva segmentáciu textu, potom prejdite na obrazovku „Recognizing“ a rozpoznaný text sa zobrazí krok za krokom a potom sa prenesie do okna „Document Proofreading“, znázornené na obrázku.
Veľa softvéru OCR má funkciu úpravy textu, ktorá rozpoznáva text, ktorý môže byť chybný, je zobrazený v čistej farbe a môže byť upravený.
(6) Uložte rozpoznaný súbor ako textový (TXT) súbor alebo súbor RTF programu Word.

