<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>OCR w dokumentach &#187; książki</title>
	<atom:link href="/tag/ksiazki/feed/" rel="self" type="application/rss+xml" />
	<link>http://ocrwdokumentach.pl</link>
	<description>Jedyny, polski blog o Optycznym Rozpoznawaniu Znaków</description>
	<lastBuildDate>Wed, 12 Aug 2015 10:43:17 +0000</lastBuildDate>
	<language>pl-PL</language>
	<sy:updatePeriod>hourly</sy:updatePeriod>
	<sy:updateFrequency>1</sy:updateFrequency>
	
	<item>
		<title>Ngram Viewer – kolejny przykład wykorzystania OCR</title>
		<link>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/</link>
		<comments>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/#comments</comments>
		<pubDate>Wed, 05 Jun 2013 12:11:37 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Informacje ogólne]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[Google]]></category>
		<category><![CDATA[Google Labs]]></category>
		<category><![CDATA[historia]]></category>
		<category><![CDATA[językoznawstwo]]></category>
		<category><![CDATA[książki]]></category>
		<category><![CDATA[ngram viewer]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[statystyki]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=243</guid>
		<description><![CDATA[<p>Pamiętacie wpis o reCAPTCHY*, który ujawniał jak na co dzień skanujemy książki? Teraz czas na system, który pozwala wykorzystać zeskanowane materiały. Ngram Viewer, bo o nim mowa, stworzony został przez</p>
<p>Post <a rel="nofollow" href="/ngram-viewer-przyklad-wykorzystania-ocr/">Ngram Viewer – kolejny przykład wykorzystania OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p><!--[if gte mso 9]><xml>
<o:OfficeDocumentSettings>
<o:RelyOnVML/>
<o:AllowPNG/>
</o:OfficeDocumentSettings>
</xml><![endif]--></p>
<p><!--[if gte mso 9]><xml>
<w:WordDocument>
<w:View>Normal</w:View>
<w:Zoom>0</w:Zoom>
<w:TrackMoves/>
<w:TrackFormatting/>
<w:HyphenationZone>21</w:HyphenationZone>
<w:PunctuationKerning/>
<w:ValidateAgainstSchemas/>
<w:SaveIfXMLInvalid>false</w:SaveIfXMLInvalid>
<w:IgnoreMixedContent>false</w:IgnoreMixedContent>
<w:AlwaysShowPlaceholderText>false</w:AlwaysShowPlaceholderText>
<w:DoNotPromoteQF/>
<w:LidThemeOther>EN-US</w:LidThemeOther>
<w:LidThemeAsian>X-NONE</w:LidThemeAsian>
<w:LidThemeComplexScript>X-NONE</w:LidThemeComplexScript>
<w:Compatibility>
<w:BreakWrappedTables/>
<w:SnapToGridInCell/>
<w:WrapTextWithPunct/>
<w:UseAsianBreakRules/>
<w:DontGrowAutofit/>
<w:SplitPgBreakAndParaMark/>
<w:EnableOpenTypeKerning/>
<w:DontFlipMirrorIndents/>
<w:OverrideTableStyleHps/>
</w:Compatibility>
<m:mathPr>
<m:mathFont m:val="Cambria Math"/>
<m:brkBin m:val="before"/>
<m:brkBinSub m:val="&#45;-"/>
<m:smallFrac m:val="off"/>
<m:dispDef/>
<m:lMargin m:val="0"/>
<m:rMargin m:val="0"/>
<m:defJc m:val="centerGroup"/>
<m:wrapIndent m:val="1440"/>
<m:intLim m:val="subSup"/>
<m:naryLim m:val="undOvr"/>
</m:mathPr></w:WordDocument>
</xml><![endif]--><!--[if gte mso 9]><xml>
<w:LatentStyles DefLockedState="false" DefUnhideWhenUsed="true"   DefSemiHidden="true" DefQFormat="false" DefPriority="99"   LatentStyleCount="267">
<w:LsdException Locked="false" Priority="0" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Normal"/>
<w:LsdException Locked="false" Priority="9" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="heading 1"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 2"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 3"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 4"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 5"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 6"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 7"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 8"/>
<w:LsdException Locked="false" Priority="9" QFormat="true" Name="heading 9"/>
<w:LsdException Locked="false" Priority="39" Name="toc 1"/>
<w:LsdException Locked="false" Priority="39" Name="toc 2"/>
<w:LsdException Locked="false" Priority="39" Name="toc 3"/>
<w:LsdException Locked="false" Priority="39" Name="toc 4"/>
<w:LsdException Locked="false" Priority="39" Name="toc 5"/>
<w:LsdException Locked="false" Priority="39" Name="toc 6"/>
<w:LsdException Locked="false" Priority="39" Name="toc 7"/>
<w:LsdException Locked="false" Priority="39" Name="toc 8"/>
<w:LsdException Locked="false" Priority="39" Name="toc 9"/>
<w:LsdException Locked="false" Priority="35" QFormat="true" Name="caption"/>
<w:LsdException Locked="false" Priority="10" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Title"/>
<w:LsdException Locked="false" Priority="1" Name="Default Paragraph Font"/>
<w:LsdException Locked="false" Priority="11" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtitle"/>
<w:LsdException Locked="false" Priority="22" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Strong"/>
<w:LsdException Locked="false" Priority="20" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Emphasis"/>
<w:LsdException Locked="false" Priority="59" SemiHidden="false"    UnhideWhenUsed="false" Name="Table Grid"/>
<w:LsdException Locked="false" UnhideWhenUsed="false" Name="Placeholder Text"/>
<w:LsdException Locked="false" Priority="1" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="No Spacing"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 1"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 1"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 1"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 1"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 1"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 1"/>
<w:LsdException Locked="false" UnhideWhenUsed="false" Name="Revision"/>
<w:LsdException Locked="false" Priority="34" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="List Paragraph"/>
<w:LsdException Locked="false" Priority="29" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Quote"/>
<w:LsdException Locked="false" Priority="30" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Quote"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 1"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 1"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 1"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 1"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 1"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 1"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 1"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 1"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 2"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 2"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 2"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 2"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 2"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 2"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 2"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 2"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 2"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 2"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 2"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 2"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 2"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 2"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 3"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 3"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 3"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 3"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 3"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 3"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 3"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 3"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 3"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 3"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 3"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 3"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 3"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 3"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 4"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 4"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 4"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 4"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 4"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 4"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 4"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 4"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 4"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 4"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 4"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 4"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 4"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 4"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 5"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 5"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 5"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 5"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 5"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 5"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 5"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 5"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 5"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 5"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 5"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 5"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 5"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 5"/>
<w:LsdException Locked="false" Priority="60" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Shading Accent 6"/>
<w:LsdException Locked="false" Priority="61" SemiHidden="false"    UnhideWhenUsed="false" Name="Light List Accent 6"/>
<w:LsdException Locked="false" Priority="62" SemiHidden="false"    UnhideWhenUsed="false" Name="Light Grid Accent 6"/>
<w:LsdException Locked="false" Priority="63" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 1 Accent 6"/>
<w:LsdException Locked="false" Priority="64" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Shading 2 Accent 6"/>
<w:LsdException Locked="false" Priority="65" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 1 Accent 6"/>
<w:LsdException Locked="false" Priority="66" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium List 2 Accent 6"/>
<w:LsdException Locked="false" Priority="67" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 1 Accent 6"/>
<w:LsdException Locked="false" Priority="68" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 2 Accent 6"/>
<w:LsdException Locked="false" Priority="69" SemiHidden="false"    UnhideWhenUsed="false" Name="Medium Grid 3 Accent 6"/>
<w:LsdException Locked="false" Priority="70" SemiHidden="false"    UnhideWhenUsed="false" Name="Dark List Accent 6"/>
<w:LsdException Locked="false" Priority="71" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Shading Accent 6"/>
<w:LsdException Locked="false" Priority="72" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful List Accent 6"/>
<w:LsdException Locked="false" Priority="73" SemiHidden="false"    UnhideWhenUsed="false" Name="Colorful Grid Accent 6"/>
<w:LsdException Locked="false" Priority="19" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtle Emphasis"/>
<w:LsdException Locked="false" Priority="21" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Emphasis"/>
<w:LsdException Locked="false" Priority="31" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Subtle Reference"/>
<w:LsdException Locked="false" Priority="32" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Intense Reference"/>
<w:LsdException Locked="false" Priority="33" SemiHidden="false"    UnhideWhenUsed="false" QFormat="true" Name="Book Title"/>
<w:LsdException Locked="false" Priority="37" Name="Bibliography"/>
<w:LsdException Locked="false" Priority="39" QFormat="true" Name="TOC Heading"/>
</w:LatentStyles>
</xml><![endif]--><!--[if gte mso 10]>


<style>
 /* Style Definitions */
table.MsoNormalTable
{mso-style-name:Standardowy;
mso-tstyle-rowband-size:0;
mso-tstyle-colband-size:0;
mso-style-noshow:yes;
mso-style-priority:99;
mso-style-parent:"";
mso-padding-alt:0cm 5.4pt 0cm 5.4pt;
mso-para-margin-top:0cm;
mso-para-margin-right:0cm;
mso-para-margin-bottom:10.0pt;
mso-para-margin-left:0cm;
line-height:115%;
mso-pagination:widow-orphan;
font-size:11.0pt;
font-family:"Calibri","sans-serif";
mso-ascii-font-family:Calibri;
mso-ascii-theme-font:minor-latin;
mso-hansi-font-family:Calibri;
mso-hansi-theme-font:minor-latin;
mso-ansi-language:EN-US;
mso-fareast-language:EN-US;}
</style>

<![endif]--></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Pamiętacie <a title="Jak digitalizujemy książki nawet o tym nie wiedząc" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/" target="_blank">wpis o reCAPTCHY</a>*, który ujawniał jak na co dzień skanujemy książki? Teraz czas na system, który pozwala wykorzystać zeskanowane materiały. Ngram Viewer, bo o nim mowa, stworzony został przez Google Labs i zawiera bazę ponad 5 milionów książek (zawierający 500 miliardów słów!) z lat 1800-2008, które poddano OCR-owaniu w firmie Larry’ego Page’a.</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Wszystkie mole książkowe, którym zaświeciły się w tym miejscu oczy, na myśl o dostępie do tych wszystkich zbiorów, muszę ostrzec: Ngram Viewer służy głównie do badań statystycznych i językoznawczych. Nie ma możliwości przeczytania danego dzieła od deski do deski, można co najwyżej podejrzeć pewne fragmenty.</span><span style="mso-ansi-language: PL;"> </span></p>
<h2>Jak to działa?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ale po kolei. Narzędzie Google służy do wyszukiwania pożądanych fraz, w danym przedziale czasowym i języku zeskanowanych publikacji. Dane zwracane są w formie wykresu, który prezentuje poziom częstotliwości występowania danego słowa na przestrzeni czasu. Możliwe jest wyszukiwanie złożonych fraz (np. atak terrorystyczny) jak i zestawianie ich ze sobą (np. Bóg i nauka jak na obrazku poniżej).</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span id="more-243"></span></p>
<p class="MsoNoSpacing" style="text-align: center;"><span style="mso-ansi-language: PL;"><img class="size-large wp-image-245 aligncenter" title="Ngram Viewer przykład wykorzystania" alt="Ngram Viewer przykład wykorzystania" src="/wp-content/uploads/2013/06/ngram_viewer1-1024x495.png" width="530" height="256" /></span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ponadto możliwe jest podejrzenie 40 wybranych przez system publikacji, które przedstawiać będą znalezione słowa. Dlaczego tylko tyle? Ponieważ w przypadku większych ilości Ngram Viewer mógłby dostać czkawki. </span></p>
<h2>„Wszystko fajnie, tylko po co”?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Do czego można wykorzystać narzędzie Google Labs? Początkowy zamysł był taki, aby narzędzie służyło głównie historykom i językoznawcom. Ngram Viewer okazuje się bardzo przydatny w badaniach lingwistycznych i w prosty sposób pozwala na wychwycenie jak zmieniała się popularność poszczególnych słów, a co za tym idzie, jak zmieniał się sam język na przestrzeni lat. Co jeszcze można wycisnąć z tego narzędzia?</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">W bardzo przejrzysty sposób można zaobserwować np. trendy w postępie technologicznym. Zestawienie fraz tj.: statek, kolej, samolot pokaże stopień i skalę przemian. Z drugiej strony można zestawiać także mężczyzn i kobiety, marketing i innowacje, otyłość i fast food itd. Warto samemu spróbować i zobaczyć co wyjdzie. Oczywiście wyniki należy traktować raczej orientacyjnie, a nie jako ścisły dowód naukowy.</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Ngram Viewer na pewno przyda się także literaturoznawcom, którzy będą mieli możliwość np. zestawienia konkretnych wyrazów opisujących emocje z daną epoką. Możliwości jest sporo<b>.</b></span></p>
<h2>A błędy?</h2>
<p style="text-align: center;"><img class="size-full wp-image-254 aligncenter" title="Słowo &quot;Congress&quot; zapisane starą czcionką" alt="Słowo &quot;Congress&quot; zapisane starą czcionką" src="/wp-content/uploads/2013/06/congress.png" width="251" height="129" /></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">O tym, że OCR nie jest wolny od błędów wie na pewno każdy czytelnik niniejszego bloga</span><span style="mso-ansi-language: PL;">. Co prawda 99%, a nawet 99,5% to sporo, ale margines błędu zawsze jest. Nie inaczej jest i w tym przypadku. Polecam prześledzenie case study słowa fuck/suck z tego <a title="Artykuł o pomyłkach w OCR" href="http://searchengineland.com/when-ocr-goes-bad-googles-ngram-viewer-the-f-word-59181" target="_blank">linka</a>. W skrócie rzecz rozbija się o pisownie „suck” w starych pismach, którą OCR interpretuje jako „fuck”, dając tym samym fałszywe wyniki wykorzystania słowa np. w XIX wieku. Swoją drogą, to nieco ironiczna pomyłka, prawda?<br />
</span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Takich błędów jest pewnie więcej, dlatego zawsze należy podchodzić do wyników z rezerwą.</span><span style="mso-ansi-language: PL;"> </span></p>
<h2>Co dalej?</h2>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Póki co system od Google Labs nie zachwyca, wziąwszy pod uwagę np. możliwość przeglądania książek, dokładność czy interfejs graficzny. Z pewnością natomiast drzemie w programie ogromny potencjał i jestem pewien, że w przyszłości będzie miał do zaoferowania dużo więcej. Ponadto jest żywym dowodem na to, że <a title="OCR-owanie dokumentów w systemie workflow" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint" target="_blank">OCR to bardzo pożyteczna technologia</a>, która zwyczajnie służy ludziom i zachowaniu ich dziedzictwa kulturowego w postaci książek.</span><span style="mso-ansi-language: PL;"> </span></p>
<p class="MsoNoSpacing" style="text-align: justify;"><span style="mso-ansi-language: PL;">Na marginesie: Ngram Viewer nie jest dostępny niestety dla polskich zbiorów. Oferuje za to języki tj.: angielski, francuski, rosyjski, niemiecki, włoski, hiszpański, hebrajski i kilka innych. Może kiedyś się doczekamy się także i naszego ojczystego.</span></p>
<p class="MsoNoSpacing" style="text-align: justify;">
<p class="MsoNoSpacing" style="text-align: justify;">* Wpis o reCAPTCHY stał się zdecydowanym hitem tego bloga. Dzięki poleceniom, linkom i portalowi wykop.pl zobaczyło go ponad 10 000 osób. Dzięki!</p>
<p>Post <a rel="nofollow" href="/ngram-viewer-przyklad-wykorzystania-ocr/">Ngram Viewer – kolejny przykład wykorzystania OCR</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/ngram-viewer-przyklad-wykorzystania-ocr/feed/</wfw:commentRss>
		<slash:comments>1</slash:comments>
		</item>
		<item>
		<title>Jak digitalizujemy książki nawet o tym nie wiedząc?</title>
		<link>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/</link>
		<comments>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/#comments</comments>
		<pubDate>Fri, 11 Jan 2013 10:46:15 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Jak działa OCR?]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[archiwum]]></category>
		<category><![CDATA[CAPTCHA]]></category>
		<category><![CDATA[digitalizacja]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[internet]]></category>
		<category><![CDATA[książki]]></category>
		<category><![CDATA[Luis von Ahn]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[Pittsburgh]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[zabezpieczenie]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=109</guid>
		<description><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest reCAPTCHA. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest<strong> reCAPTCHA</strong>. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie wiedząc. Jak to możliwe?</p>
<p>Rejestrując się na stronie lub na forum, zazwyczaj na koniec tego procesu witryna zmusza Cię do udowodnienia, że nie jesteś botem do rozpowszechniania <strong>spamu</strong>. Co robisz? W 90% przypadków przepisujesz kod/wyraz z wyświetlonego obrazka obrazka. Tak działa m.in. reCAPTCHA.</p>
<p>Jak to się ma do <a title="System OCR" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint">OCR-a</a>? Nawet najlepsze systemy nie są w stanie rozpoznać 100% skanowanych wyrazów. Obecnie skuteczność tego typu programów kształtuje się na poziomie 90-98%, w zależności od wykorzystywanych algorytmów i jakości skanowanego tekstu. To oznacza, że przy tekście zawierającym 20 000 słów, wciąż od 400 do 2000 pozostaje do rozpoznania przez człowieka.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA2.png"><img class="alignnone  wp-image-113" title="Błędne rozpoznanie systemu OCR" src="/wp-content/uploads/2013/01/reCAPTCHA2.png" alt="Błędne rozpoznanie systemu OCR" width="489" height="97" /></a></p>
<p><span id="more-109"></span></p>
<p>Tymczasem na <strong>Uniwersytecie Carnegie-Mellona w Pittsburghu</strong>, zastanawiano się jak szybko i małym nakładem sił można digitalizować książki i stare egzemplarze gazet. Tak powstał projekt reCAPTCHA. Mechanizm jest w gruncie rzeczy bardzo prosty. Użytkownik, by zakończyć np. rejestrację, musi przepisać dwa słowa podane przez program. W przypadku rozwiązania naukowców z Pittsburga, jedno z nich jest słowem kontrolnym (znanym przez system), natomiast drugie, to słowo nieprawidłowo rozpoznane przez moduł OCR.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA.png"><img class="size-full wp-image-114 aligncenter" title="reCAPTCHA w praktyce" src="/wp-content/uploads/2013/01/reCAPTCHA.png" alt="reCAPTCHA w praktyce" width="341" height="185" /></a></p>
<p><strong>Kolejność wyrazów jest losowa</strong>, natomiast ich jakość zbliżona, dlatego internauta nigdy nie wie, które z nich stanowi zabezpieczenie. Jeśli dane słowo, przez różnych użytkowników, zostanie trzykrotnie jednakowo zweryfikowane, wówczas system przesyła je do źródła jako rozpoznane. W przypadku kiedy trzej pierwsi użytkownicy nie podali jednakowo brzmiących odpowiedzi, wówczas wyraz prezentowany jest większej ilości osób, a decyzja o jego ostatecznym brzmieniu podejmowana jest na podstawie najczęściej pojawiających się odpowiedzi. Skuteczność tej metody wynosi<strong> ponad 99,5%</strong>, co przy ilości rozpoznawanych słów jest wynikiem imponującym.</p>
<p>ReCAPTCHA funkcjonuje od 2009 roku i w pierwszych 12 miesiącach od wprowadzenia udało się zdigitalizować aż <strong>17 tysięcy książek</strong>. Szacuje się, że aż <strong>200 milionów kodów</strong> zabezpieczających CAPTCHA rozwiązywanych jest codziennie przez internautów na całym świecie. Proces ten zajmuje około 10 sekund, co daje sumarycznie niebagatelną ilość zrealizowanych <strong>150 tysięcy roboczogodzin</strong>, każdego dnia.</p>
<p>Geniusz reCAPTCHY leży w kilku czynnikach. Przede wszystkim jest to rozwiązanie podwójnie pożyteczne. Z jednej strony webmasterzy zabezpieczają swoje strony i fora internetowe przed spamem. Z drugiej, rozpoznawane są słowa, z którymi nie radzi sobie OCR. Natomiast najlepszy w tym wszystkim jest fakt, że odbywa się w to sposób niemalże <strong>niezauważalny i nie wymagający wysiłku</strong> dla pojedynczego użytkownika. A do tego wszystkiego, reCAPTCHE można zaimplementować bardzo łatwo i zupełnie <strong>za darmo</strong>. Czego chcieć więcej?</p>
<p>Nie wiem jak Wy, ale według mnie twórcy (<strong>Luis von Ahn</strong>, Ben Maurer, Colin McMillen, David Abraham i Manuel Blum) powinni na stałe wpisać się w kanon osób, które pożytecznie przyczyniły się dla społeczeństwa światowego. ReCAPTCHA codziennie pozwala na utrwalenie kilkudziesięciu książek, które w przeciwnym przypadku już nigdy mogłyby nie być dostępne dla szerszej publiki.</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/feed/</wfw:commentRss>
		<slash:comments>26</slash:comments>
		</item>
	</channel>
</rss>
