Runājot par teksta atpazīšanas programmatūru OCR
Mēs esam liels poligrāfijas uzņēmums Shenzhen Ķīnā. Piedāvājam visas grāmatu publikācijas, cieto grāmatu drukāšanu, papīra grāmatu drukāšanu, papīra grāmatu drukāšanu, papīra grāmatiņu drukāšanu, grāmatu iespiešanu, bukletu drukāšanu, iepakojuma kasti, kalendārus, visu veidu PVC, produktu brošūras, piezīmes, bērnu grāmatu, uzlīmes, visus dažāda veida papīra krāsu drukas produkti, spēļu karte un tā tālāk.
Lai iegūtu vairāk informācijas, lūdzu, apmeklējiet vietni
http://www.joyful-printing.com. Tikai ENG
http://www.joyful-printing.net
http://www.joyful-printing.org
e-pasts: info@joyful-printing.net
Ķīniešu rakstzīmju atpazīšanas programmatūras uzdevums ir pētīt, kā padarīt datoru "izglītotu". Sistēma parasti izmanto fotoelektrisko pārveidotāju, lai pārveidotu ķīniešu rakstzīmi vai vārdu kasti par elektrisko signālu, un nosūta to datoram, ko automātiski atpazīst un lasa dators, tāpēc to sauc par optisko. Optisko rakstzīmju atpazīšana (OCR).
OCR izstrādes profils
OCR koncepciju pirmo reizi ierosināja vācu zinātnieks Tausheck 1929. gadā. Vēlāk amerikāņu zinātnieks Handels ierosināja ideju izmantot tehnoloģiju, lai identificētu vārdus. Agrākais pētījums par drukāto ķīniešu rakstzīmju atzīšanu bija Casey un IBM no IBM. 1966. gadā viņi publicēja pirmo rakstu par ķīniešu rakstzīmju atpazīšanu, kurā tika izmantota veidņu saskaņošana, lai identificētu 1000 drukātas ķīniešu rakstzīmes. Septiņdesmito gadu sākumā japāņu zinātnieki sāka mācīties ķīniešu rakstzīmju atpazīšanu un daudz strādāja. Ķīniešu rakstzīmju atpazīšanas pētījumi Ķīnā sākās salīdzinoši vēlu, un OCR pētnieciskais darbs sākās 1970. gadu beigās. Agrīna OCR programmatūra nespēja izpildīt faktiskās prasības dažādu faktoru, piemēram, atzīšanas ātruma un producēšanas dēļ. Tajā pašā laikā, pateicoties augstajām aparatūras aprīkojuma izmaksām un lēno darbības ātrumu, tas nav sasniedzis praktisku līmeni. OCR programmatūru izmanto tikai daži departamenti, piemēram, informācijas nodaļas, preses un publikāciju nodaļas. Pēc 1986. gada Ķīnas OCR pētījumi ir guvuši lielu progresu, un tas ir radījis inovācijas ķīniešu rakstzīmju modelēšanas un atpazīšanas metodēs. Tā ir sasniegusi auglīgus rezultātus sistēmas izstrādes un izstrādes lietojumos. Daudzas vienības ir uzsākušas ķīniešu OCR produktus. Pēc deviņdesmitajiem gadiem ar plašu platformu skeneru pielietojumu un informācijas automatizācijas un biroja automatizācijas popularizēšanu Ķīnā, OCR tehnoloģijas turpmāka attīstība ir ievērojami veicināta, un atpazīšanas ātrums ir atpazīts, un atpazīšanas ātrums ir apmierināts lietotājiem. Prasība.
Pašlaik ir daudz populāru OCR programmatūru. Angļu valodas OCR galvenokārt ietver OmniPage, Ķīnas OCR, galvenokārt Tsinghua Unisplendour OCR, Tsinghua Wentong OCR, Hanwang OCR, Zhongjing Shangshu OCR, Danqing OCR un Mengyu OCR. Neskatoties uz lielo ķīniešu rakstzīmju un sarežģīto fontu skaitu, OCR tehnoloģija ir nobriedusi. Daudzas OCR programmatūras var atpazīt ne tikai melnbaltās drukātas ķīniešu rakstzīmes, bet arī atpazīt pelēktoņu un krāsu drukātas ķīniešu rakstzīmes. Atzīšanas ātrums ir ātrs un atpazīšanas precizitātes koeficients pārsniedz 99%. Tā var atpazīt dažādus fontus, piemēram, Dziesmu, Boldu un Skorpionu. Tradicionāli; var atpazīt dažādus fontus, dažādu burtu izmēru sajaukšanu; dažas OCR programmatūras var arī identificēt attēlus, tabulas. Tajā pašā laikā ir gūti ievērojami panākumi Ķīnas rokraksta atpazīšanas pētījumā, un pareizais atzīšanas līmenis ir sasniedzis vairāk nekā 70%.
OCR programmatūras lietojumprogramma
Skeneru tirgū daudzu veidu biroja un mājas skeneri ir aprīkoti ar OCR programmatūru. Piemēram, violetais skeneris ir aprīkots ar violetu OCR, kristāla skeneris ir aprīkots ar Shangshu OCR, un Mustek skeneris ir aprīkots ar Danqing OCR. Skeneris un OCR programmatūra koplieto visu procesu no dokumenta ievadīšanas līdz teksta atpazīšanai.
Dokumentu skenēšana bieži tiek izmantota biroja laukā. Dokumenti, kas saistīti ar publikācijām laikrakstos, žurnālos utt., Tiek skenēti ar skeneri, un pēc tam tiek veikta OCR identifikācija vai saglabāta kā attēla fails, vēlākai OCR atpazīšanai, un attēlu faili tiek pārvērsti tekstā. Failu vai Word failu glabāšanai.
Turklāt digitālās informācijas uzglabāšana un pārsūtīšana ir ne tikai zema izmaksu, augsta efektivitāte, bet arī pielāgojama nesagatavotām drukas un tīkla pārraides vajadzībām. Šobrīd Ķīnā ir daudz papīra dārgumu, piemēram, grāmatu, laikrakstu, žurnālu utt., Un tas ir steidzami jāpārvērš elektroniskajā informācijā. Piemēram, elektroniskās bibliotēkas izveidei nepieciešams, lai grāmatas tiktu skenētas pēc lapas, un OCR programmatūras identifikācija aizvieto manuālo vārdu ievadīšanu, kas ievērojami saīsina ieraksta laiku, samazina darba intensitāti, ietaupa darbaspēku un samazina izmaksas. Uzlabojiet ieejas precizitāti, darba efektivitāti un modernu biroja automatizāciju.
Pašlaik OCR programmatūras un skeneru kombinācija ir pielietota daudzās informācijas laikmeta jomās, piemēram, digitālās bibliotēkas, dažādu ziņojumu identificēšana un banku un nodokļu sistēmas standartu noteikšana. Attīstoties un popularizējot tīklu un informāciju, tā piemērošanas joma kļūs arvien plašāka.
OCR sistēmas sastāvs
Ķīniešu rakstzīmju atpazīšanas programmatūras OCR funkcija ir atpazīt dažādas ķīniešu rakstzīmju grafikas vai attēlus, kas ierakstīti ķīniešu rakstzīmes, izdrukas vai rokraksti ar datoru, un atzīmēt ķīniešu rakstzīmju kategorijas kodus. Tāpēc ķīniešu rakstzīmju atpazīšana ir attēlu atpazīšanas problēma. Sakarā ar lielo ķīniešu rakstzīmju skaitu, dažādiem fontiem, fontiem un sarežģītām struktūrām, ķīniešu rakstzīmju atpazīšanas process ir ļoti sarežģīts. OCR programmatūras darbplūsmas shematiska diagramma, kā parādīts šajā tabulā:
Dokumentu dati → skenēšanas ievade → attēlu apstrāde → izkārtojuma sadalījums → teksta atpazīšana → teksta rediģēšana → dokumentu glabāšana
Skeneru popularitātes un plašā pielietojuma dēļ OCR programmatūrai ir nepieciešams tikai nodrošināt saskarni ar skeneri un izmantot skenera draivera programmatūru. Tāpēc OCR programmatūra sastāv galvenokārt no attēlu apstrādes moduļa, izkārtojuma sadalīšanas moduļa, teksta atpazīšanas moduļa un teksta rediģēšanas moduļa.
1. Attēlu apstrādes modulis
Attēlu apstrādes modulim galvenokārt ir tādas funkcijas kā dokumentu skenēšana, attēlu mērogošana un attēla rotācija. Pēc skenera ievadīšanas dokuments veido attēla failu, un attēlu apstrādes modulis var palielināt attēlu, lai noņemtu traipus un skrāpējumus. Ja attēls netiek pareizi pagriezts, attēlu var pagriezt manuāli vai automātiski, lai radītu labākus nosacījumus teksta atpazīšanai. Atzīšanas līmenis ir augstāks.
2. Izvietojuma modulis
Izkārtojuma sadalījuma modulis galvenokārt ietver izkārtojuma sadalījumu un izmaiņu sadalījumu, tas ir, izkārtojumu, vārdu segmentāciju, normalizāciju utt., Kā arī automātisko vai manuālo izkārtojumu var izvēlēties. Mērķis ir informēt OCR programmatūru, lai nodalītu rakstus, tabulas utt. Tādā pašā izkārtojumā, lai tos varētu apstrādāt atsevišķi un kādā secībā.
3. Teksta atpazīšanas modulis
Teksta atpazīšanas modulis ir OCR programmatūras pamatdaļa, vienkārša teksta atpazīšanas procesa diagramma, kā parādīts zemāk. Teksta atpazīšanas modulis galvenokārt veic "lasīšanu" uz ieejas ķīniešu rakstzīmēm, bet tas nevar būt vairāku līniju, un tas ir jāsamazina pēc rindas. Ķīniešu rakstzīmēm to parasti atpazīst viens vārds un viens vārds, tas ir, viena vārda atpazīšana un pēc tam normalizēts. Teksta atpazīšanas modulis iegūst dažādu ķīniešu rakstu zīmju iezīmes, pabeidz atzīšanu, automātiski atrod aizdomīgus vārdus un ir tādas funkcijas kā pirms un pēc asociācijas.
Skenēšanas ieejas oriģināls → līnijas griešana → vārdu griešana → naturalizācija → atpazīšanas funkcijas iegūšana → vārdu atpazīšana ┐ ┐
└- → Iepriekšējas klasifikācijas funkciju ieguve → Funkciju bibliotēka (vārdnīca) → Izejas manuskripts
4. Teksta rediģēšanas modulis
Teksta rediģēšanas modulis galvenokārt maina un rediģē OCR atpazīto tekstu. Ja sistēma atpazīst, ka tā ir nepareiza, teksts tiks parādīts treknrakstā sarkanā vai zilā krāsā un sniegs līdzīgu tekstu atlasīšanai un atlasiet izvades redaktoru.
Kā lietot OCR programmatūru
Lai gan ir daudz OCR programmatūras veidu, to izmantošana ir līdzīga. Pirmais solis ir skenēt dokumentu un pēc tam veikt OCR atpazīšanu. OCR programmatūras izmantošana ir šāda:
1. Dokumentu skenēšana
Lai izmantotu OCR programmatūru teksta atpazīšanai, dokumentus var skenēt tieši OCR programmatūrā. Pēc OCR programmatūras palaišanas parādīsies OCR programmatūras saskarne.
Ievietojiet skenējamo dokumentu skenera stikla pusē tā, lai skenējamā puse saskaras ar skenera stikla pusi ar dokumenta augšējo galu uz leju, saskaņotu ar lineāla malu un pēc tam skeneris ir lai sagatavotos skenēšanai. Noklikšķiniet uz pogas "Skenēt" logā, lai ievadītu skenēšanas draivera programmatūru skenēšanai. Skenēšanas metode šeit netiks aprakstīta. Tomēr jāatzīmē, ka izšķirtspēju var iestatīt uz 200 ~ 400 dpi. Teksta dokumentiem ir ļoti svarīgi pielāgot spilgtumu.
2. OCR atpazīšana
Lai atvieglotu lietošanu, izvēlnē atlasiet opcijas un loga kreisajā pusē parādās dažādas ikonas.
Lai labāk izmantotu, vispirms no ekrāna no kreisās puses no augšas uz leju ieviesiet ikonu:
"Palielināt" rīks: attēla palielināšanai; "tālināt" rīks: attēla samazināšanai; "atpazīšanas zonas iestatīšana" rīks: atpazīšanas zonas iestatīšanai; "atpazīšanas secības iestatīšana": atpazīšanas secības iestatīšanai; Delete Recognition Area rīks: lai dzēstu atpazīšanas zonu; Rīks "Dzēst attēla troksni": lai izdzēstu attēlu apgabalā; "Rotēt attēlu" rīks: lai pagrieztu attēlu 90 °, 180 ° vai 270 °; Slīpuma korekcijas rīks: manuāla attēla slīpuma korekcijai.
Vispārīgi OCR identifikācijas soļi:
(1) Pēc dokumenta skenēšanas logā redzamais teksts ir ļoti mazs. Pirmkārt, atlasiet rīku “Tuvināt”, lai pareizi palielinātu attēlu, lai padarītu attēlu skaidrāku. Ja nepieciešams, varat arī izvēlēties "tālināt" rīku, lai atbilstoši samazinātu ekrāna izmēru.
(2) Ja ekrānu nepieciešams pagriezt par 90 °, 180 ° vai 270 °, izmantojiet Rotate Image (Pagriezt attēlu) rīku, lai pagrieztu attēlu. Ja teksta ekrāns ir pagriezts, atlasiet slīpuma korekcijas rīku, lai pielāgotu ekrānu.
(3) Atzīšanas laikā atlasiet rīku "Iestatīt atpazīšanas zonu" un rāmīt apgabalu, kas jāatzīst rakstzīmju ekrānā. Šādā gadījumā vairākus laukus var ierāmēt atbilstoši ekrāna stāvoklim. Ja kadrētais apgabals ir nepareizs, varat izmantot rīku Dzēst identifikācijas apgabalu, lai izdzēstu izvēlēto atzīto apgabalu.
(4) Lai uzlabotu atpazīšanas ātrumu, ja izvēlētajā atpazīšanas zonā ir troksnis vai neatpazīstams attēls, rīku "Dzēst attēla troksni" var izvēlēties, lai izdzēstu troksni pa bitēm. Ja jums ir jāizdzēš gabalos, varat izvēlēties rīku Wipe Image Block.
(5) Noklikšķiniet uz ikonas “Atzīt”, tad OCR displejs veic teksta segmentāciju, pēc tam pārsūta uz “Atzīšanas” ekrānu, un atpazītais teksts tiks parādīts soli pa solim, un pēc tam tiek pārvietots uz “Dokumentu korektūras” logu kā parādīts.
Daudzās OCR programmatūrās ir teksta pārveidošanas funkcija, kas atpazīst tekstu, kas var būt kļūdains, tiek rādīts skaidrā krāsā un var tikt mainīts.
(6) Saglabājiet atzīto failu kā teksta (TXT) failu vai Word RTF failu.

