<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>OCR w dokumentach &#187; skanowanie</title>
	<atom:link href="/tag/skanowanie/feed/" rel="self" type="application/rss+xml" />
	<link>http://ocrwdokumentach.pl</link>
	<description>Jedyny, polski blog o Optycznym Rozpoznawaniu Znaków</description>
	<lastBuildDate>Wed, 12 Aug 2015 10:43:17 +0000</lastBuildDate>
	<language>pl-PL</language>
	<sy:updatePeriod>hourly</sy:updatePeriod>
	<sy:updateFrequency>1</sy:updateFrequency>
	
	<item>
		<title>Dokumenty papierowe a bezpieczeństwo danych</title>
		<link>http://ocrwdokumentach.pl/dokumenty-papierowe-a-bezpieczenstwo/</link>
		<comments>http://ocrwdokumentach.pl/dokumenty-papierowe-a-bezpieczenstwo/#comments</comments>
		<pubDate>Tue, 20 Aug 2013 10:07:08 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Informacje ogólne]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[bezpieczeństwo]]></category>
		<category><![CDATA[BPM]]></category>
		<category><![CDATA[BPMS]]></category>
		<category><![CDATA[DMS]]></category>
		<category><![CDATA[dokument]]></category>
		<category><![CDATA[elektroniczny dokument]]></category>
		<category><![CDATA[elektroniczny obieg dokumentów]]></category>
		<category><![CDATA[Kevin Mitnick]]></category>
		<category><![CDATA[korespondencja]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[papier]]></category>
		<category><![CDATA[papierowy dokument]]></category>
		<category><![CDATA[skan]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[system]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=299</guid>
		<description><![CDATA[<p>Znacie Kevina Mitnicka? To najsłynniejszy hacker na świecie, o którym Hollywood nakręcił film (Takedown, 2000). Zapewne słysząc słowo „hacker”, większość osób ma w wyobraźni obraz typowego „kujona” we flanelowej koszulki,</p>
<p>Post <a rel="nofollow" href="/dokumenty-papierowe-a-bezpieczenstwo/">Dokumenty papierowe a bezpieczeństwo danych</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Znacie <strong>Kevina Mitnicka</strong>? To najsłynniejszy hacker na świecie, o którym Hollywood nakręcił film (Takedown, 2000). Zapewne słysząc słowo „hacker”, większość osób ma w wyobraźni obraz typowego „kujona” we flanelowej koszulki, który od komputera odchodzi tylko po to, aby zaspokoić swoje podstawowe potrzeby życiowe. Dużo mniej osób jednak wie, że Mitnick swój sukces zawdzięcza nie tylko znajomościom systemów komputerowych, ale także socjotechnice i tzw. <strong>dumpster divingowi</strong> (brzmi mądrze, lecz chodzi o pospolite grzebanie w śmieciach, w tym przypadku w poszukiwaniu przydatnych danych). Wszak najsłabszym ogniwem każdego systemu jest zawsze człowiek.</p>
<p>Mitnick, w książce „Sztuka Podstępu” udowadniał jak <strong>wiele ważnych informacji można znaleźć w pojemniku na odpady</strong> umieszczonym obok siedziby firmy. Dane pracowników, numery kont bankowych, korespondencję i wiele innych. Posiadając taką wiedzę, manipulowanie pracownikami okazywało się czynnością dziecinnie prostą.</p>
<p style="text-align: center;"><img class="aligncenter size-full wp-image-300" alt="Elektroniczne dokumenty vs papierowe dokumenty" src="/wp-content/uploads/2013/08/elektroniczny-dokument1.jpg" width="247" height="204" /></p>
<p>Jednakże wciąż w bardzo wielu organizacjach, kiedy przywołany zostaje temat zastąpienia papierowych dokumentów elektronicznymi, pracownicy obawiają się o bezpieczeństwo. Brak wiedzy, ignorancja czy zbytnie przyzwyczajenie do papieru? Przyjrzyjmy się <strong>jakie największe zagrożenia niesie ze sobą wykorzystywanie papierowych dokumentów</strong>.</p>
<p><span id="more-299"></span></p>
<h2>1. „Gdzieś się zapodział”.</h2>
<p>Około <strong>50%</strong> przypadków naruszenia bezpieczeństwa danych wynika z zagubienia dokumentu papierowego. I nic dziwnego. Często wędrują one po całej firmie, od działu do działu. Składane są na kupki, wkładane do segregatorów i szuflad. Przechodzą przez ręce kilkunastu(dziesięciu) pracowników i tylko kwestią czasu jest jak któryś z nich się zapodzieje. Nie ma jasnej ewidencji u kogo się aktualnie znajduje, kto i kiedy zmienił jego położenie. Pół biedy, jeśli został źle skatalogowany. Dużo gorzej w przypadku gdy trafia w niewłaściwe ręce. A konkurencja nie śpi&#8230;</p>
<h2>2. „Tego tu nie było”.</h2>
<p>Kolejnym zagrożeniem jakie stwarzają dokumenty papierowe jest manipulowanie danymi. O ile w <a title="System BPM z OCR i kodami kreskowymi" href="http://www.webcon.pl/workflow-sekretariat" target="_blank">systemie klasy BPM/DMS</a>, który pilnuje użytkowników w trakcie wprowadzania informacji, bardzo ciężko jest zawrzeć nieprawdziwe informacje (szczególnie jeśli system ten jest zintegrowany z <strong>OCR</strong> i na podstawie skanu uzupełnia pola). O tyle w przypadku dokumentu papierowego, zamienienie trójki na ósemkę czy sfałszowanie podpisu jest dużo łatwiejsze.</p>
<h2>3. „A te dokumenty to pana?”</h2>
<p>Dokumenty swobodnie leżące na biurku, zostawione w ogólnodostępnej drukarce, w koszu na śmieci, niezamknięte szafki, omyłkowo wysłane faksy itd. Potencjalnych zagrożeń jest wiele, a <strong>nieautoryzowany dostęp do poufnych informacji</strong> może być fatalny w skutkach. Tymczasem elektroniczny obieg dokumentów pozwala na zdefiniowanie kto będzie miał dostęp do których informacji. Ponadto dane mogą być szyfrowane i nawet w przypadku kiedy dostaną się w niepowołane ręce, mogą być chronione.</p>
<p><img class="aligncenter size-full wp-image-301" alt="Elektroniczny obieg dokumentów" src="/wp-content/uploads/2013/08/elektroniczny-dokument2.jpg" width="419" height="208" /></p>
<h2>Wnioski</h2>
<p>„<em>Jeżeli jesteśmy do czegoś przyzwyczajeni, sądzimy, że nam się to sprawiedliwie należy. Postęp nie ma większego wroga niż przyzwyczajenie</em>”. Przytoczone słowa José Martíego, perfekcyjnie wręcz odzwierciedlają największą przeszkodę, która stoi na drodze do pozbycia się papieru.<strong> Ludzkie nawyki bywają największą barierą</strong> w implementacji nowych rozwiązań. Należy jednak patrzeć na nie z punktu widzenia korzyści: większej produktywności, bezpieczeństwa, a w efekcie i wygody. Bo gdy przyzwyczaimy pracowników do nowego sposobu działania, nie będą już chcieli wracać do starych metod.</p>
<p>Post <a rel="nofollow" href="/dokumenty-papierowe-a-bezpieczenstwo/">Dokumenty papierowe a bezpieczeństwo danych</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/dokumenty-papierowe-a-bezpieczenstwo/feed/</wfw:commentRss>
		<slash:comments>0</slash:comments>
		</item>
		<item>
		<title>Google Drive i darmowy OCR</title>
		<link>http://ocrwdokumentach.pl/google-drive-darmowy-ocr/</link>
		<comments>http://ocrwdokumentach.pl/google-drive-darmowy-ocr/#comments</comments>
		<pubDate>Thu, 18 Jul 2013 09:52:46 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[chmura]]></category>
		<category><![CDATA[dane]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[dysk]]></category>
		<category><![CDATA[GIF]]></category>
		<category><![CDATA[Google Drive]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[PDF]]></category>
		<category><![CDATA[przechowywanie]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[zdjęcia]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=277</guid>
		<description><![CDATA[<p>Interesuje Cię OCR, ale nie będziesz skanować tak dużo, aby opłacalne było kupno specjalistycznego oprogramowania? „Wujek Google” ma dla Ciebie rozwiązanie. Oferuje Optyczne Rozpoznawanie Znaków przy okazji korzystania z Google</p>
<p>Post <a rel="nofollow" href="/google-drive-darmowy-ocr/">Google Drive i darmowy OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Interesuje Cię OCR, ale nie będziesz skanować tak dużo, aby opłacalne było kupno specjalistycznego oprogramowania? „Wujek Google” ma dla Ciebie rozwiązanie. Oferuje Optyczne Rozpoznawanie Znaków przy okazji korzystania z Google Drive. Skanować można także używając aplikacji mobilnej na Androida. Brzmi nieźle? Zobaczmy jak to wygląda w praktyce.</p>
<p>Cały proces jest bardzo prosty. Umieszczając plik PDF lub zdjęcie (JPG, GIF, PNG) na Dysku Google możemy skorzystać z funkcji OCR. Wówczas zostanie on zeskanowany i przekonwertowany do formy tekstowej. Przy tym wszystko odbywa się w chmurze przy minimalnej ingerencji użytkownika końcowego. System obsługuje 34 języki, wśród których jest także polski, a z trudniejszych do odczytania także rosyjski, chiński (uproszczony) i kilka innych rodem z Azji.</p>
<p><img class="aligncenter size-full wp-image-278" alt="Google Drive i OCR" src="/wp-content/uploads/2013/07/gdrive-560x273.png" width="481" height="235" /><br />
Usługa ma jednak swoje limity. Pliki graficzne nie mogą przekraczać 2MB, a pliki PDF 10-u stron. Ponadto materiał poddawany skanowaniu powinien być dobrej jakości, szczególnie jeśli chodzi o rozdzielczość, jakość obrazu czy orientację. Do zadań firmowych to zdecydowanie za mało, jednakże dla zastosowań domowych powinno wystarczyć.</p>
<p><span id="more-277"></span><br />
Sporo możliwości daje natomiast aplikacja mobilna, która niedawno doczekała się aktualizacji. Mocno odświeżony został interfejs, a także dodano kilka nowych opcji. Z punktu widzenia tematyki, którą poruszam najbardziej interesująca jest możliwość skanowania z poziomu smartfona. Wystarczy, że zrobimy zdjęcie, np. dokumentowi czy ulotce, a tekst który się tam znajduje zostanie rozpoznany i przekonwertowany do pliku PDF. Szybko, łatwo i przyjemnie. Zastosowań może być sporo, a zważywszy że większość z nas smartfona ma przez większość czasu pod ręką, może się faktycznie przydać. Podejrzewam, że rozwiązanie to szczególnie może zainteresować studentów, którzy będą chcieli skanować notatki, skrypty itp.</p>
<p>Aplikacja dostępna jest w sklepie Google Play, za darmo, pod tym adresem: https://play.google.com/store/apps/details?id=com.google.android.apps.docs</p>
<p>Bez wątpienia Google oferuje użytkownikom swojego wirtualnego dysku sporo przydatnych opcji. Wśród niszczących się dokumentów papierowych, porysowanych płyt CD/DVD i uszkodzonych pendrive’ów, możliwość trzymania plików w chmurze bywa bardzo przydatna i w miarę bezpieczna. Oczywiście pod warunkiem że zabezpieczymy się dobrym, i tylko nam znanym, hasłem.</p>
<p>Przy okazji nie wiem czy wiecie, ale Google przejęło <a title="Zobacz jak działa reCAPTCHA" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/" target="_blank">projekt reCAPTCHY</a>. W związku z powyższym przepisując tekst kontrolny na rozmaitych forach i stronach internetowych możemy teoretycznie pomagać w skanowaniu… swoich własnych tekstów umieszczanych w Google Drive.</p>
<p>A tak na zakończenie (w ramach ciekawostki): zwolennicy teorii spiskowych twierdzą, iż drugim dnem dla którego funkcjonuje Google Drive, jest fakt pozyskiwania danych przez Google o swoich użytkownikach. Ciężko to ocenić, choć oczywiście jest to możliwe. Dlatego na wszelki wypadek kluczowe informacje przetrzymujmy mimo wszystko na tradycyjnych nośnikach.</p>
<p>Post <a rel="nofollow" href="/google-drive-darmowy-ocr/">Google Drive i darmowy OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/google-drive-darmowy-ocr/feed/</wfw:commentRss>
		<slash:comments>6</slash:comments>
		</item>
		<item>
		<title>5 największych przeszkód w OCR-owaniu</title>
		<link>http://ocrwdokumentach.pl/5-najwiekszych-przeszkod-w-ocr-owaniu/</link>
		<comments>http://ocrwdokumentach.pl/5-najwiekszych-przeszkod-w-ocr-owaniu/#comments</comments>
		<pubDate>Fri, 21 Jun 2013 09:45:12 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Jak działa OCR?]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[biblioteka]]></category>
		<category><![CDATA[czcionka]]></category>
		<category><![CDATA[druk]]></category>
		<category><![CDATA[firma]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[Optyczne Rozpoznawanie Znaków]]></category>
		<category><![CDATA[problemy]]></category>
		<category><![CDATA[przedsiębiorstwo]]></category>
		<category><![CDATA[przeszkody]]></category>
		<category><![CDATA[skan]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[tekst]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=266</guid>
		<description><![CDATA[<p>Optical Character Recognition (OCR) to technologia bez wątpienia przydatna i pożyteczna. Nie jest jednak pozbawiona wad. O niedoskonałościach w rozpoznawaniu znaków napomknąłem już wcześniej. Teraz chciałbym przedstawić inne problemy, które</p>
<p>Post <a rel="nofollow" href="/5-najwiekszych-przeszkod-w-ocr-owaniu/">5 największych przeszkód w OCR-owaniu</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Optical Character Recognition (OCR) to technologia bez wątpienia przydatna i pożyteczna. Nie jest jednak pozbawiona wad. O <a title="Jak wybrać dobre oprogramowanie OCR" href="/ocr-jak-wybrac-dobry-software/" target="_blank">niedoskonałościach w rozpoznawaniu</a> znaków napomknąłem już wcześniej. Teraz chciałbym przedstawić inne problemy, które negatywnie wpływają na rozpoznawanie znaków.</p>
<p>OCR świetnie sprawdza się w firmach – tam zazwyczaj skanowane wydruki są dobrej jakości i większość programów bez problemu rozpoznaje między 95 a 99% znaków. Dużo gorzej jest np. w przypadku bibliotek. Tam, niektóre ze zbiorów (często już wiekowych) nie stwarzają już tak dobrych warunków do digitalizacji tekstu. Książki bywają zniszczone, pisane archaicznym językiem i niespotykaną obecnie czcionką. To oczywiście dość ekstremalne przypadki, ale dobrze obrazują przeszkody jakie napotyka oprogramowanie.</p>
<p style="text-align: center;"><a href="/wp-content/uploads/2013/06/OCR-logo.jpg"><img class="size-full wp-image-267 aligncenter" title="Problemy w pełnotekstowym skanowaniu OCR" alt="Problemy w pełnotekstowym skanowaniu OCR" src="/wp-content/uploads/2013/06/OCR-logo.jpg" width="271" height="226" /></a></p>
<p>Przyjrzyjmy się co bywa największym problemem w pełnotekstowym skanowaniu.</p>
<p><span id="more-266"></span></p>
<p>1. Jednym z najczęstszych problemów jest <strong>słaba jakość druku źródłowego</strong>. W przypadku gdy liczba (gęstość) pikseli jest zbyt mała, programy zwyczajnie się gubią, dając albo niepoprawne wyniki, albo w ogóle nie rozpoznając znaków i poszczególnych słów. Jest to najczęstszy i uniwersalny problem dotyczący skanowania.</p>
<p>2. <strong>Brak jednolitości tekstu</strong> to kolejny czynnik, który zaniża skuteczność rozpoznawania. Korzystanie z różnych czcionek i różnych wielkości ujemnie wpływa na możliwość poprawnego zeskanowania tekstu. W miarę możliwości należy tego unikać, aby otrzymać jak najlepszy efekt.</p>
<p>3. <strong>Wyblakłe kolory i zbyt mały kontrast</strong>. Optymalnie byłoby, gdyby skanowany tekst miał czcionkę o głębokiej czerni. Niestety rzeczywistość jest mniej różowa i często okazuje się, że barwa poszczególnych liter nie jest wystarczająco wyrazista. Warto także zwrócić uwagę na fakt, iż użycie innych kolorów niż czarny,co również może być przeszkodą dla OCR-a.</p>
<p>4. <strong>Tekst</strong> nie powinien być także <strong>zbyt gęsty</strong>. Zbyt duże nagromadzenie tekstu na stronie (liter, paragrafów) może poskutkować niższą skutecznością.</p>
<p>5. <strong>Rozmiar czcionki</strong> również ma znaczenie. Minimalny próg, w zależności od rodzaju stosowanych algorytmów przez OCR, powinien wynosić między 6 a 8.</p>
<p>Co by nie mówić, technologia idzie do przodu. Programy do rozpoznawania znaków są coraz lepsze, tak jak i materiały skanowane na co dzień (choćby faktury czy umowy). Jestem ciekaw kiedy doczekamy</p>
<p>Na koniec ciekawostka. Znaczenie ma także rodzaj skanowanego papieru (materiału). Ze względu na nietypowy, jak na dzisiejsze czasy, skład papieru, skanowaniu nie poddaje się większości tekstów wydanych przed 1850 rokiem. Aby to zrobić konieczne są dodatkowe analizy oraz ustawienie niestandardowych parametrów dla OCR-a, dostosowanych do skanowanego materiału.</p>
<p>Post <a rel="nofollow" href="/5-najwiekszych-przeszkod-w-ocr-owaniu/">5 największych przeszkód w OCR-owaniu</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/5-najwiekszych-przeszkod-w-ocr-owaniu/feed/</wfw:commentRss>
		<slash:comments>0</slash:comments>
		</item>
		<item>
		<title>Ngram Viewer – kolejny przykład wykorzystania OCR</title>
		<link>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/</link>
		<comments>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/#comments</comments>
		<pubDate>Wed, 05 Jun 2013 12:11:37 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Informacje ogólne]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[Google]]></category>
		<category><![CDATA[Google Labs]]></category>
		<category><![CDATA[historia]]></category>
		<category><![CDATA[językoznawstwo]]></category>
		<category><![CDATA[książki]]></category>
		<category><![CDATA[ngram viewer]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[statystyki]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=243</guid>
		<description><![CDATA[<p>Pamiętacie wpis o reCAPTCHY*, który ujawniał jak na co dzień skanujemy książki? Teraz czas na system, który pozwala wykorzystać zeskanowane materiały. Ngram Viewer, bo o nim mowa, stworzony został przez</p>
<p>Post <a rel="nofollow" href="/ngram-viewer-przyklad-wykorzystania-ocr/">Ngram Viewer – kolejny przykład wykorzystania OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p><!--[if gte mso 9]><xml>
<o:OfficeDocumentSettings>
<o:RelyOnVML/>
<o:AllowPNG/>
</o:OfficeDocumentSettings>
</xml><![endif]--></p>
<p><!--[if gte mso 9]><xml>
<w:WordDocument>
<w:View>Normal</w:View>
<w:Zoom>0</w:Zoom>
<w:TrackMoves/>
<w:TrackFormatting/>
<w:HyphenationZone>21</w:HyphenationZone>
<w:PunctuationKerning/>
<w:ValidateAgainstSchemas/>
<w:SaveIfXMLInvalid>false</w:SaveIfXMLInvalid>
<w:IgnoreMixedContent>false</w:IgnoreMixedContent>
<w:AlwaysShowPlaceholderText>false</w:AlwaysShowPlaceholderText>
<w:DoNotPromoteQF/>
<w:LidThemeOther>EN-US</w:LidThemeOther>
<w:LidThemeAsian>X-NONE</w:LidThemeAsian>
<w:LidThemeComplexScript>X-NONE</w:LidThemeComplexScript>
<w:Compatibility>
<w:BreakWrappedTables/>
<w:SnapToGridInCell/>
<w:WrapTextWithPunct/>
<w:UseAsianBreakRules/>
<w:DontGrowAutofit/>
<w:SplitPgBreakAndParaMark/>
<w:EnableOpenTypeKerning/>
<w:DontFlipMirrorIndents/>
<w:OverrideTableStyleHps/>
</w:Compatibility>
<m:mathPr>
<m:mathFont m:val="Cambria Math"/>
<m:brkBin m:val="before"/>
<m:brkBinSub m:val="&#45;-"/>
<m:smallFrac m:val="off"/>
<m:dispDef/>
<m:lMargin m:val="0"/>
<m:rMargin m:val="0"/>
<m:defJc m:val="centerGroup"/>
<m:wrapIndent m:val="1440"/>
<m:intLim m:val="subSup"/>
<m:naryLim m:val="undOvr"/>
</m:mathPr></w:WordDocument>
</xml><![endif]--><!--[if gte mso 9]><xml>
<w:LatentStyles DefLockedState="false" DefUnhideWhenUsed="true"   DefSemiHidden="true" DefQFormat="false" DefPriority="99"   LatentStyleCount="267">
<w:LsdException Locked="false" Priority="0" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Normal"/>
<w:LsdException Locked="false" Priority="9" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="heading 1"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 2"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 3"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 4"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 5"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 6"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 7"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 8"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 9"/>
<w:LsdException Locked="false" Priority="39" Name="toc 1"/>
<w:LsdException Locked="false" Priority="39" Name="toc 2"/>
<w:LsdException Locked="false" Priority="39" Name="toc 3"/>
<w:LsdException Locked="false" Priority="39" Name="toc 4"/>
<w:LsdException Locked="false" Priority="39" Name="toc 5"/>
<w:LsdException Locked="false" Priority="39" Name="toc 6"/>
<w:LsdException Locked="false" Priority="39" Name="toc 7"/>
<w:LsdException Locked="false" Priority="39" Name="toc 8"/>
<w:LsdException Locked="false" Priority="39" Name="toc 9"/>
<w:LsdException Locked="false" Priority="35" QFormat="true" Name="caption"/>
<w:LsdException Locked="false" Priority="10" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Title"/>
<w:LsdException Locked="false" Priority="1" Name="Default Paragraph Font"/>
<w:LsdException Locked="false" Priority="11" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtitle"/>
<w:LsdException Locked="false" Priority="22" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Strong"/>
<w:LsdException Locked="false" Priority="20" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Emphasis"/>
<w:LsdException Locked="false" Priority="59" SemiHidden="false"    UnhideWhenUsed="false" Name="Table Grid"/>
<w:LsdException Locked="false" UnhideWhenUsed="false" Name="Placeholder Text"/>
<w:LsdException Locked="false" Priority="1" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="No Spacing"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 1"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 1"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 1"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 1"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 1"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 1"/>
<w:LsdException Locked="false" UnhideWhenUsed="false" Name="Revision"/>
<w:LsdException Locked="false" Priority="34" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="List Paragraph"/>
<w:LsdException Locked="false" Priority="29" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Quote"/>
<w:LsdException Locked="false" Priority="30" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Quote"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 1"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 1"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 1"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 1"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 1"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 1"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 1"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 1"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 2"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 2"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 2"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 2"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 2"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 2"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 2"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 2"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 2"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 2"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 2"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 2"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 2"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 2"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 3"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 3"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 3"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 3"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 3"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 3"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 3"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 3"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 3"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 3"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 3"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 3"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 3"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 3"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 4"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 4"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 4"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 4"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 4"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 4"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 4"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 4"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 4"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 4"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 4"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 4"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 4"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 4"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 5"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 5"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 5"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 5"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 5"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 5"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 5"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 5"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 5"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 5"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 5"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 5"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 5"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 5"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 6"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 6"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 6"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 6"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 6"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 6"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 6"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 6"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 6"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 6"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 6"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 6"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 6"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 6"/>
<w:LsdException Locked="false" Priority="19" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtle Emphasis"/>
<w:LsdException Locked="false" Priority="21" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Emphasis"/>
<w:LsdException Locked="false" Priority="31" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtle Reference"/>
<w:LsdException Locked="false" Priority="32" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Reference"/>
<w:LsdException Locked="false" Priority="33" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Book Title"/>
<w:LsdException Locked="false" Priority="37" Name="Bibliography"/>
<w:LsdException Locked="false" Priority="39" QFormat="true" Name="TOC Heading"/>
</w:LatentStyles>
</xml><![endif]--><!--[if gte mso 10]>


<style>
 /* Style Definitions */
table.MsoNormalTable
{mso-style-name:Standardowy;
mso-tstyle-rowband-size:0;
mso-tstyle-colband-size:0;
mso-style-noshow:yes;
mso-style-priority:99;
mso-style-parent:"";
mso-padding-alt:0cm 5.4pt 0cm 5.4pt;
mso-para-margin-top:0cm;
mso-para-margin-right:0cm;
mso-para-margin-bottom:10.0pt;
mso-para-margin-left:0cm;
line-height:115%;
mso-pagination:widow-orphan;
font-size:11.0pt;
font-family:"Calibri","sans-serif";
mso-ascii-font-family:Calibri;
mso-ascii-theme-font:minor-latin;
mso-hansi-font-family:Calibri;
mso-hansi-theme-font:minor-latin;
mso-ansi-language:EN-US;
mso-fareast-language:EN-US;}
</style>

<![endif]--></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Pamiętacie <a title="Jak digitalizujemy książki nawet o tym nie wiedząc" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/" target="_blank">wpis o reCAPTCHY</a>*, który ujawniał jak na co dzień skanujemy książki? Teraz czas na system, który pozwala wykorzystać zeskanowane materiały. Ngram Viewer, bo o nim mowa, stworzony został przez Google Labs i zawiera bazę ponad 5 milionów książek (zawierający 500 miliardów słów!) z lat 1800-2008, które poddano OCR-owaniu w firmie Larry’ego Page’a.</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Wszystkie mole książkowe, którym zaświeciły się w tym miejscu oczy, na myśl o dostępie do tych wszystkich zbiorów, muszę ostrzec: Ngram Viewer służy głównie do badań statystycznych i językoznawczych. Nie ma możliwości przeczytania danego dzieła od deski do deski, można co najwyżej podejrzeć pewne fragmenty.</span><span style="mso-ansi-language: PL;"> </span></p>
<h2>Jak to działa?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ale po kolei. Narzędzie Google służy do wyszukiwania pożądanych fraz, w danym przedziale czasowym i języku zeskanowanych publikacji. Dane zwracane są w formie wykresu, który prezentuje poziom częstotliwości występowania danego słowa na przestrzeni czasu. Możliwe jest wyszukiwanie złożonych fraz (np. atak terrorystyczny) jak i zestawianie ich ze sobą (np. Bóg i nauka jak na obrazku poniżej).</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span id="more-243"></span></p>
<p class="MsoNoSpacing" style="text-align: center;"><span style="mso-ansi-language: PL;"><img class="size-large wp-image-245 aligncenter" title="Ngram Viewer przykład wykorzystania" alt="Ngram Viewer przykład wykorzystania" src="/wp-content/uploads/2013/06/ngram_viewer1-1024x495.png" width="530" height="256" /></span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ponadto możliwe jest podejrzenie 40 wybranych przez system publikacji, które przedstawiać będą znalezione słowa. Dlaczego tylko tyle? Ponieważ w przypadku większych ilości Ngram Viewer mógłby dostać czkawki. </span></p>
<h2>„Wszystko fajnie, tylko po co”?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Do czego można wykorzystać narzędzie Google Labs? Początkowy zamysł był taki, aby narzędzie służyło głównie historykom i językoznawcom. Ngram Viewer okazuje się bardzo przydatny w badaniach lingwistycznych i w prosty sposób pozwala na wychwycenie jak zmieniała się popularność poszczególnych słów, a co za tym idzie, jak zmieniał się sam język na przestrzeni lat. Co jeszcze można wycisnąć z tego narzędzia?</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">W bardzo przejrzysty sposób można zaobserwować np. trendy w postępie technologicznym. Zestawienie fraz tj.: statek, kolej, samolot pokaże stopień i skalę przemian. Z drugiej strony można zestawiać także mężczyzn i kobiety, marketing i innowacje, otyłość i fast food itd. Warto samemu spróbować i zobaczyć co wyjdzie. Oczywiście wyniki należy traktować raczej orientacyjnie, a nie jako ścisły dowód naukowy.</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ngram Viewer na pewno przyda się także literaturoznawcom, którzy będą mieli możliwość np. zestawienia konkretnych wyrazów opisujących emocje z daną epoką. Możliwości jest sporo<b>.</b></span></p>
<h2>A błędy?</h2>
<p style="text-align: center;"><img class="size-full wp-image-254 aligncenter" title="Słowo &quot;Congress&quot; zapisane starą czcionką" alt="Słowo &quot;Congress&quot; zapisane starą czcionką" src="/wp-content/uploads/2013/06/congress.png" width="251" height="129" /></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">O tym, że OCR nie jest wolny od błędów wie na pewno każdy czytelnik niniejszego bloga</span><span style="mso-ansi-language: PL;">. Co prawda 99%, a nawet 99,5% to sporo, ale margines błędu zawsze jest. Nie inaczej jest i w tym przypadku. Polecam prześledzenie case study słowa fuck/suck z tego <a title="Artykuł o pomyłkach w OCR" href="http://searchengineland.com/when-ocr-goes-bad-googles-ngram-viewer-the-f-word-59181" target="_blank">linka</a>. W skrócie rzecz rozbija się o pisownie „suck” w starych pismach, którą OCR interpretuje jako „fuck”, dając tym samym fałszywe wyniki wykorzystania słowa np. w XIX wieku. Swoją drogą, to nieco ironiczna pomyłka, prawda?<br />
</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Takich błędów jest pewnie więcej, dlatego zawsze należy podchodzić do wyników z rezerwą.</span><span style="mso-ansi-language: PL;"> </span></p>
<h2>Co dalej?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Póki co system od Google Labs nie zachwyca, wziąwszy pod uwagę np. możliwość przeglądania książek, dokładność czy interfejs graficzny. Z pewnością natomiast drzemie w programie ogromny potencjał i jestem pewien, że w przyszłości będzie miał do zaoferowania dużo więcej. Ponadto jest żywym dowodem na to, że <a title="OCR-owanie dokumentów w systemie workflow" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint" target="_blank">OCR to bardzo pożyteczna technologia</a>, która zwyczajnie służy ludziom i zachowaniu ich dziedzictwa kulturowego w postaci książek.</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Na marginesie: Ngram Viewer nie jest dostępny niestety dla polskich zbiorów. Oferuje za to języki tj.: angielski, francuski, rosyjski, niemiecki, włoski, hiszpański, hebrajski i kilka innych. Może kiedyś się doczekamy się także i naszego ojczystego.</span></p>
<p class="MsoNoSpacing" style="text-align: justify;">
<p class="MsoNoSpacing" style="text-align: justify;">* Wpis o reCAPTCHY stał się zdecydowanym hitem tego bloga. Dzięki poleceniom, linkom i portalowi wykop.pl zobaczyło go ponad 10 000 osób. Dzięki!</p>
<p>Post <a rel="nofollow" href="/ngram-viewer-przyklad-wykorzystania-ocr/">Ngram Viewer – kolejny przykład wykorzystania OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/feed/</wfw:commentRss>
		<slash:comments>1</slash:comments>
		</item>
		<item>
		<title>Jak digitalizujemy książki nawet o tym nie wiedząc?</title>
		<link>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/</link>
		<comments>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/#comments</comments>
		<pubDate>Fri, 11 Jan 2013 10:46:15 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Jak działa OCR?]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[archiwum]]></category>
		<category><![CDATA[CAPTCHA]]></category>
		<category><![CDATA[digitalizacja]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[internet]]></category>
		<category><![CDATA[książki]]></category>
		<category><![CDATA[Luis von Ahn]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[Pittsburgh]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[zabezpieczenie]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=109</guid>
		<description><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest reCAPTCHA. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest<strong> reCAPTCHA</strong>. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie wiedząc. Jak to możliwe?</p>
<p>Rejestrując się na stronie lub na forum, zazwyczaj na koniec tego procesu witryna zmusza Cię do udowodnienia, że nie jesteś botem do rozpowszechniania <strong>spamu</strong>. Co robisz? W 90% przypadków przepisujesz kod/wyraz z wyświetlonego obrazka obrazka. Tak działa m.in. reCAPTCHA.</p>
<p>Jak to się ma do <a title="System OCR" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint">OCR-a</a>? Nawet najlepsze systemy nie są w stanie rozpoznać 100% skanowanych wyrazów. Obecnie skuteczność tego typu programów kształtuje się na poziomie 90-98%, w zależności od wykorzystywanych algorytmów i jakości skanowanego tekstu. To oznacza, że przy tekście zawierającym 20 000 słów, wciąż od 400 do 2000 pozostaje do rozpoznania przez człowieka.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA2.png"><img class="alignnone  wp-image-113" title="Błędne rozpoznanie systemu OCR" src="/wp-content/uploads/2013/01/reCAPTCHA2.png" alt="Błędne rozpoznanie systemu OCR" width="489" height="97" /></a></p>
<p><span id="more-109"></span></p>
<p>Tymczasem na <strong>Uniwersytecie Carnegie-Mellona w Pittsburghu</strong>, zastanawiano się jak szybko i małym nakładem sił można digitalizować książki i stare egzemplarze gazet. Tak powstał projekt reCAPTCHA. Mechanizm jest w gruncie rzeczy bardzo prosty. Użytkownik, by zakończyć np. rejestrację, musi przepisać dwa słowa podane przez program. W przypadku rozwiązania naukowców z Pittsburga, jedno z nich jest słowem kontrolnym (znanym przez system), natomiast drugie, to słowo nieprawidłowo rozpoznane przez moduł OCR.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA.png"><img class="size-full wp-image-114 aligncenter" title="reCAPTCHA w praktyce" src="/wp-content/uploads/2013/01/reCAPTCHA.png" alt="reCAPTCHA w praktyce" width="341" height="185" /></a></p>
<p><strong>Kolejność wyrazów jest losowa</strong>, natomiast ich jakość zbliżona, dlatego internauta nigdy nie wie, które z nich stanowi zabezpieczenie. Jeśli dane słowo, przez różnych użytkowników, zostanie trzykrotnie jednakowo zweryfikowane, wówczas system przesyła je do źródła jako rozpoznane. W przypadku kiedy trzej pierwsi użytkownicy nie podali jednakowo brzmiących odpowiedzi, wówczas wyraz prezentowany jest większej ilości osób, a decyzja o jego ostatecznym brzmieniu podejmowana jest na podstawie najczęściej pojawiających się odpowiedzi. Skuteczność tej metody wynosi<strong> ponad 99,5%</strong>, co przy ilości rozpoznawanych słów jest wynikiem imponującym.</p>
<p>ReCAPTCHA funkcjonuje od 2009 roku i w pierwszych 12 miesiącach od wprowadzenia udało się zdigitalizować aż <strong>17 tysięcy książek</strong>. Szacuje się, że aż <strong>200 milionów kodów</strong> zabezpieczających CAPTCHA rozwiązywanych jest codziennie przez internautów na całym świecie. Proces ten zajmuje około 10 sekund, co daje sumarycznie niebagatelną ilość zrealizowanych <strong>150 tysięcy roboczogodzin</strong>, każdego dnia.</p>
<p>Geniusz reCAPTCHY leży w kilku czynnikach. Przede wszystkim jest to rozwiązanie podwójnie pożyteczne. Z jednej strony webmasterzy zabezpieczają swoje strony i fora internetowe przed spamem. Z drugiej, rozpoznawane są słowa, z którymi nie radzi sobie OCR. Natomiast najlepszy w tym wszystkim jest fakt, że odbywa się w to sposób niemalże <strong>niezauważalny i nie wymagający wysiłku</strong> dla pojedynczego użytkownika. A do tego wszystkiego, reCAPTCHE można zaimplementować bardzo łatwo i zupełnie <strong>za darmo</strong>. Czego chcieć więcej?</p>
<p>Nie wiem jak Wy, ale według mnie twórcy (<strong>Luis von Ahn</strong>, Ben Maurer, Colin McMillen, David Abraham i Manuel Blum) powinni na stałe wpisać się w kanon osób, które pożytecznie przyczyniły się dla społeczeństwa światowego. ReCAPTCHA codziennie pozwala na utrwalenie kilkudziesięciu książek, które w przeciwnym przypadku już nigdy mogłyby nie być dostępne dla szerszej publiki.</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/feed/</wfw:commentRss>
		<slash:comments>26</slash:comments>
		</item>
		<item>
		<title>Czym jest OCR – optyczne rozpoznawanie znaków?</title>
		<link>http://ocrwdokumentach.pl/czym-jest-ocr/</link>
		<comments>http://ocrwdokumentach.pl/czym-jest-ocr/#comments</comments>
		<pubDate>Fri, 12 Oct 2012 10:55:56 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Informacje ogólne]]></category>
		<category><![CDATA[definicja]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[działanie]]></category>
		<category><![CDATA[Google Docs]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[rozpoznawanie]]></category>
		<category><![CDATA[schemat]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[znaki]]></category>
		<category><![CDATA[znaków]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=11</guid>
		<description><![CDATA[<p>OCR (z ang. Optical Character Recognition) &#8211; Optyczne Rozpoznawanie Znaków. Oprogramowanie służące do analizy tekstu pisanego, drukowanego bądź odręcznego, a następnie jego konwersji do postaci elektronicznej (w formie plików .txt,</p>
<p>Post <a rel="nofollow" href="/czym-jest-ocr/">Czym jest OCR – optyczne rozpoznawanie znaków?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<h4><strong>OCR</strong> (z ang. Optical Character Recognition) &#8211; Optyczne Rozpoznawanie Znaków.</h4>
<p>Oprogramowanie służące do analizy tekstu pisanego, drukowanego bądź odręcznego, a następnie jego konwersji do postaci elektronicznej (w formie plików .txt, .doc lub .pdf), umożliwiającej dalszą edycję. Technologia ta znajduje szerokie zastosowanie m.in. w przedsiębiorstwach (rejestrowanie dokumentów i wniosków) i bibliotekach (archiwizacja zbiorów).</p>
<h4>Prosty schemat działania systemu OCR:</h4>
<p><a href="/wp-content/uploads/2012/10/ocr.gif"><img class="alignleft  wp-image-49" title="ocr2" alt="Optical Character Recognition2" src="/wp-content/uploads/2012/10/ocr.gif" width="366" height="100" /></a></p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>Najpierw dokument skanowany jest za pomocą skanera. Następnie przetwarzany przez komputer z odpowiednim oprogramowaniem. W efekcie końcowym wyświetlany jest edytowalny tekst. Metoda rozpoznawania różna jest w zależności od wykorzystanych algorytmów. Obecnie najlepsze programy OCR zapewniają skuteczność na poziomie 99%-99,5%, co oznacza że wciąż zachodzi konieczność manualnej weryfikacji rozpoznania niektórych słów.</p>
<p><span id="more-11"></span></p>
<h3>Przykład wykorzystania OCR przez Google Docs:<br />
<a href="/wp-content/uploads/2012/10/Google-Docs-OCR.png"><img class="alignleft size-full wp-image-54" title="Google Docs OCR" alt="Google Docs OCR" src="/wp-content/uploads/2012/10/Google-Docs-OCR.png" width="414" height="224" /></a></h3>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<h4>Poniżej filmik przedstawiający w praktyce wykorzystanie OCR. W tym przypadku z wykorzystaniem systemu elektronicznego obiegu dokumentów.</h4>
<p><a href="http://www.youtube.com/watch?feature=player_embedded&amp;v=0P1pcM8Bd1o">Rejestracja faktury w systemie obiegu dokumentów</a></p>
<p>Post <a rel="nofollow" href="/czym-jest-ocr/">Czym jest OCR – optyczne rozpoznawanie znaków?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/czym-jest-ocr/feed/</wfw:commentRss>
		<slash:comments>3</slash:comments>
		</item>
		<item>
		<title>Witaj na blogu o OCR!</title>
		<link>http://ocrwdokumentach.pl/blog-oc/</link>
		<comments>http://ocrwdokumentach.pl/blog-oc/#comments</comments>
		<pubDate>Fri, 05 Oct 2012 15:19:32 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Bez kategorii]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[ENIAC]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[skaner]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[technologia]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=1</guid>
		<description><![CDATA[<p>Technologie informatyczne są nieodłącznym elementem naszego życia. Jeszcze w 1946 roku uważano komputer ENIAC (Electronic Numerical Integrator And Computer) za szczyt rozwoju myśli technicznej. Wówczas ten amerykański wynalazek zajmował powierzchnię</p>
<p>Post <a rel="nofollow" href="/blog-oc/">Witaj na blogu o OCR!</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Technologie informatyczne są nieodłącznym elementem naszego życia. Jeszcze w 1946 roku uważano komputer ENIAC (<em>Electronic Numerical Integrator And Computer) </em>za szczyt rozwoju myśli technicznej. Wówczas ten amerykański wynalazek zajmował powierzchnię zbliżoną do rozmiarów boiska do piłki nożnej, a cała aparatura ważyła ok. 27 ton. Jego moc obliczeniowa była wiele razy niższa, od tej którą obecnie posiadają najprostsze kalkulatory.</p>
<p>Komputer ENIAC, 1946 rok:</p>
<p><a href="/wp-content/uploads/2012/10/ENIAC_Image_2.jpg"><img class="alignnone size-large wp-image-41" title="ENIAC" alt="ENIAC" src="/wp-content/uploads/2012/10/ENIAC_Image_2-1024x690.jpg" width="530" height="357" /></a></p>
<p>Tymczasem to, co w połowie XX wieku pozostawało co najwyżej w sferze marzeń, dziś jest rzeczywistością. Bankowość internetowa, e-maile czy portale społecznościowe, to tylko kilka przykładów rozwiązań, z których większość z nas korzysta na co dzień. Celem niniejszego bloga jest przybliżenie czytelnikowi technologii, która choć nie uzyskała powszechnego rozgłosu, z roku na rok udowadnia, że jej wykorzystanie może znacząco przyczynić się do ułatwienia codziennych zadań, szczególnie w sferze pracy. Mowa tu o systemie <a href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint">Optical Character Recognition (OCR)</a>, zamieniającym w ciągu kilku sekund tekst na papierze, w tekst elektroniczny.</p>
<p>&nbsp;</p>
<p><span id="more-5"></span></p>
<p>Pozycjonowanie:</p>
<p><a title="skocz.com - Największy Katalog Stron www" href="http://skocz.com" target="_blank"><img alt="skocz.com - Największy Katalog Stron www" src="http://skocz.com/pic/skocz.com.png" /></a><br />
<a title="Darmowy katalog SEO" href="http://darmowykatalogseo.pl" target="_blank"><strong>Darmowy katalog SEO</strong></a><br />
<a href="http://katalog.promocje.biz" target="_blank"><img alt="katalog stron" src="http://katalog.promocje.biz/but.png" width="80" height="15" border="0" /></a><br />
<a title="Katalog stron" href="http://katalogin.pl" target="_blank"><strong>Katalog stron</strong></a><br />
<a title="Katalogseo24.pl - button (80x15)" href="http://www.katalogseo24.pl" target="_blank"><img alt="Katalogseo24.pl - button (80x15)" src="http://www.katalogseo24.pl/button2.gif" /></a><br />
<a title="SEO-One24.net - button (80x15)" href="http://seo-one24.net" target="_blank"><img alt="SEO-One24.net - button (80x15)" src="http://seo-one24.net/baner2.jpg" /></a><br />
<a title="Katalog Jarmin" href="http://jarmin.pl" target="_blank"><strong>Katalog Jarmin</strong></a><br />
<a title="Darmowy katalog stron" href="http://darmowykatalogstron.pl" target="_blank"><strong>Darmowy katalog stron</strong></a><br />
<a title="Dodaj swoją stronę do naszego katalogu" href="http://dodaj.info" target="_blank"><img alt="Dodaj swoją stronę do naszego katalogu" src="http://dodaj.info/pic/dodaj.info.png" /></a><br />
<a href="http://www.katalog.kz1.pl" target="_blank"><img alt="katalog stron" src="http://www.katalog.kz1.pl/graf/button.gif" border="0" /></a><br />
<a title="Katalog Blogów" href="http://blooger.pl" target="_blank"><img alt="Katalog Blogów" src="http://blooger.pl/pic/blooger.pl.png" /></a><br />
<a title="Linki SEO 24 - button (80x15)" href="http://linki-seo24.net" target="_blank"><img alt="Linki SEO 24 - button (80x15)" src="http://linki-seo24.net/button.gif" /></a><br />
<a title="SEO OKatalog" href="http://okatalog.pl" target="_blank"><img alt="SEO OKatalog" src="http://okatalog.pl/pic/okatalog.pl.png" /></a><br />
<a title="Se-site.pl" href="http://se-site.pl" target="_blank"><strong>Se-site.pl</strong></a><br />
<a title="Gorący Katalog HotLink" href="http://katalog.hotlink.pl" target="_blank"><img alt="Gorący Katalog HotLink" src="http://katalog.hotlink.pl/pic/katalog.hotlink.pl.png" /></a><br />
<a title="Katalog Linuxiarzy" href="http://katalog.linuxiarze.pl" target="_blank"><strong>Katalog Linuxiarzy</strong></a><br />
<a title="Katalog stron www" href="http://katalog.sylwiawoj.pl" target="_blank"><img alt="Katalog stron www" src="http://katalog.sylwiawoj.pl/logo_katalog.jpg" /></a><br />
<a title="katalog stron" href="http://www.zielonykatalog.net" target="_blank"><strong>katalog stron</strong></a><br />
<a title="MaszTu.pl nowoczesny katalog stron www" href="http://MaszTu.pl" target="_blank"><img alt="MaszTu.pl nowoczesny katalog stron www" src="http://ospi.pl/banery/masztu.gif" /></a><br />
<a title="Spis katalogów" href="http://www.multikody.info" target="_blank"><strong>Spis katalogów</strong></a><br />
<a title="Katalog Stron" href="http://www.cdk.pl" target="_blank"><strong>Katalog Stron</strong></a><br />
<a title="Katalog stron - Grubas" href="http://www.grubas.eu" target="_blank"><strong>Katalog stron &#8211; Grubas</strong></a><br />
<a title="Katalog SEO" href="http://www.katalogstronseo.info" target="_blank"><strong>Katalog SEO</strong></a><br />
<a title="Katalog dokumenty" href="http://www.dokumenty.biz" target="_blank"><strong>Katalog dokumenty</strong></a><br />
<a href="http://www.top-rank.pl/" target="_blank"><img alt="Statystyki, katalog stron www, dobre i ciekawe strony internetowe" src="http://www.top-rank.pl/button.php?u=l4gp0w" border="0" /></a></p>
<p>Post <a rel="nofollow" href="/blog-oc/">Witaj na blogu o OCR!</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/blog-oc/feed/</wfw:commentRss>
		<slash:comments>1</slash:comments>
		</item>
	</channel>
</rss>
