<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>OCR w dokumentach &#187; Ciekawostki</title>
	<atom:link href="/category/ciekawostki/feed/" rel="self" type="application/rss+xml" />
	<link>http://ocrwdokumentach.pl</link>
	<description>Jedyny, polski blog o Optycznym Rozpoznawaniu Znaków</description>
	<lastBuildDate>Wed, 12 Aug 2015 10:43:17 +0000</lastBuildDate>
	<language>pl-PL</language>
	<sy:updatePeriod>hourly</sy:updatePeriod>
	<sy:updateFrequency>1</sy:updateFrequency>
	
	<item>
		<title>CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</title>
		<link>http://ocrwdokumentach.pl/captcha-kontra-spam/</link>
		<comments>http://ocrwdokumentach.pl/captcha-kontra-spam/#comments</comments>
		<pubDate>Tue, 29 Oct 2013 12:07:03 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Ciekawostki]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[CAPTCHA]]></category>
		<category><![CDATA[CRAPTCHA]]></category>
		<category><![CDATA[ludzka farma]]></category>
		<category><![CDATA[łamanie]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[spam]]></category>
		<category><![CDATA[spambot]]></category>
		<category><![CDATA[webmaster]]></category>
		<category><![CDATA[zabezpieczenia]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=392</guid>
		<description><![CDATA[<p>Spam jest prawie tak stary jak Internet. Oprócz wirusów, trojanów, malware’u itp. jest największą plagą cyberprzestrzeni. Któż z nas nie dostał e-maila z reklamą cudownych tabletek na powiększenie męskiego&#8230; hardware’u</p>
<p>Post <a rel="nofollow" href="/captcha-kontra-spam/">CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Spam jest prawie tak stary jak Internet. Oprócz wirusów, trojanów, malware’u itp. jest największą plagą cyberprzestrzeni. Któż z nas nie dostał e-maila z reklamą cudownych tabletek na powiększenie męskiego&#8230; hardware’u :)? Od dekady jednym z najskuteczniejszych mechanizmów zabezpieczenia stron internetowych i forów dyskusyjnych jest wykorzystywanie (re)CAPTCHY. Jednak i ten mur udaje się rozbić, m.in. dzięki mechanizmom <strong>OCR</strong> &#8211; Optycznego Rozpoznawania Znaków.</p>
<p>Obecnie oprócz reklamowania szemranych produktów i usług, spam na stronach internetowych służy również m.in. do: manipulowania wynikami ankiet, masowego linkowania, rozprowadzania złośliwego kodu czy naruszania integralności kodu stron. Szacuje się, że aż <strong>90% wiadomości wysyłanych w Internecie to spam</strong>.</p>
<p>Od dekady jednym ze skuteczniejszych mechanizmów służących do obrony przed spamem jest <strong>CAPTCHA</strong> oraz jej pochodne tj. <a title="Czym jest RECAPTCHA?" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/" target="_blank">reCAPTCHA</a>. Pomysłowość osób rozsyłających spam sięga coraz dalej i nawet CAPTCHA niekiedy bywa zawodna. Zobaczmy jakie są 3 najczęstsze sposoby jej łamania:</p>
<p><span id="more-392"></span></p>
<h2>OCR</h2>
<p>Technologia Optical Character Recognition nieustannie się rozwija. Obecnie topowe rozwiązania potrafią rozpoznać 99% znaków w przypadku dokumentów o przyzwoitej jakości. Fakt ten nie umknął spamerom, którzy coraz częściej wykorzystują OCR do <strong>łamania kodów</strong> serwowanych przez CAPTCHE. W wielu przypadkach nawet szumy, zakłócenia i zniekształcenia to zbyt mało by przeszkodzić w rozpoznaniu znaków.</p>
<p>Obecnie wiele haseł serwowanych przez programy zabezpieczające jest tak trudna, że nawet ludzie mają problemy z jej rozpoznaniem. Wszystko wskazuje na to, że ciągłe udoskonalanie programów OCR doprowadzi do zmierzchu CAPTCHy, która swoim skomplikowaniem zniechęca wielu użytkowników do jej rozwiązywania i podejmowania wielokrotnych prób. Stworzono nawet mechanizm <a title="CRAPTCHA - impossible CAPTCHA" href="http://laughingsquid.com/crapcha-impossible-captcha-tests-that-prank-web-users/ " target="_blank">CRAPTCHA</a> stworzony do <strong>trollowania sfrustrowanych internautów</strong> poprzez przedstawianie znaków niemożliwych do przepisania.</p>
<p>Smutny jest niestety fakt, iż technologia, która powinna służyć pożytecznym i ambitnym projektom, tj. <strong>digitalizacja starych księgozbiorów</strong>, wykorzystywana jest do ułatwienia spamerom zaśmiecania sieci. Sytuacja ta przypomina nieco losy najsłynniejszego wynalazku Alfreda Nobla. Dynamit z założenia miał pomagać w rozwoju cywilizacyjnym, lecz po pewnym czasie został wykorzystany przeciwko cywilizacji.</p>
<p><a href="/wp-content/uploads/2013/10/suspicion.png"><img class="aligncenter size-full wp-image-394" alt="CAPTCHA zabija boty" src="/wp-content/uploads/2013/10/suspicion.png" width="551" height="167" /></a></p>
<h2>Ludzkie farmy</h2>
<p>Innym sposobem radzenia sobie z mechanizmami CAPTCHA jest tania siła robocza. Jak to działa? <strong>Spamboty</strong> próbując dostać się do danej strony internetowej napotykają na hasło do rozwiązania. Robią zrzut ekranu i wysyłają go do osób, które zdecydowały się za grosze (1-2$ dziennie) rozpoznawać tego typu tekst. Wprowadzenie takiego trybu działania w państwach zachodnich byłoby nieopłacalne ze względu na koszt pracy. Niestety wykorzystanie<strong> taniej siły roboczej</strong> z krajów tj. Indie, Pakistan czy Filipiny umożliwia zastosowanie tego typu metod. Ile to kosztuje? Za rozwiązanie 5000 CAPTCHY zapłacimy niecałe&#8230; 7 dolarów.</p>
<h2>Fałszywa CAPTCHA</h2>
<p>Szukasz w Internecie informacji. Aby uzyskać do niej dostęp musisz rozwiązać CAPTCHE. Wprowadzasz hasło. Źle. Drugi raz. Trzeci. Za czwartym wiesz już na pewno, że wprowadziłeś poprawne dane, a mimo to nie możesz przejść dalej. Właśnie <strong>stałeś się częścią darmowej ludzkiej farmy do rozpoznawania znaków</strong>. Mechanizm jest bardzo podobny jak w poprzednio omawianym przypadku, z tą różnicą że wykorzystuje nieświadomość użytkownika i podstawia mu kod, który tak naprawdę posłuży kolejnemu spambotowi.</p>
<p><a href="/wp-content/uploads/2013/10/constructive.png"><img class="aligncenter size-full wp-image-393" alt="Pożyteczne spamboty" src="/wp-content/uploads/2013/10/constructive.png" width="492" height="176" /></a></p>
<p>Zabezpieczenie cyberprzestrzeni staje się coraz trudniejsze dla webmasterów i coraz bardziej uciążliwe dla użytkowników.  <strong>Obecnie rozwiązanie CAPTCHY zajmuje około 15-20 sekund. To wystarczająco dużo, aby porzucić stronę.</strong> Szczególnie jeśli jedna próba nie wystarczy. Na rynku pojawiają się coraz nowsze rozwiązania. Wśród nich obiecująco zapowiadają się proste i interaktywne animacje, w których np. trzeba sportowcom przydzielić odpowiedni do zajmowanego miejsca medal.</p>
<p>Wszystko wskazuje na to, że <strong>wojna spamerów z webmasterami nigdy się nie skończy</strong>. Zmienią się jedynie narzędzia prowadzenia walki. Najwięcej ucierpią niestety cywile, czyli my – zwykli Internauci.</p>
<p>Komiksy pochodzą ze strony: xkcd.com</p>
<p>AKTUALIZACJA:</p>
<p>Z ostatniej chwili: w sieci pojawił się filmik, którego autorzy twierdzą, że złamali CATPCHę. Do obejrzenia (i poczytania) tutaj: http://www.wired.com/wiredscience/2013/10/captcha-busted/</p>
<p>Post <a rel="nofollow" href="/captcha-kontra-spam/">CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/captcha-kontra-spam/feed/</wfw:commentRss>
		<slash:comments>2</slash:comments>
		</item>
		<item>
		<title>ZXX – sposób na przechytrzenie NSA</title>
		<link>http://ocrwdokumentach.pl/zxx-sposob-na-przechytrzenie-nsa/</link>
		<comments>http://ocrwdokumentach.pl/zxx-sposob-na-przechytrzenie-nsa/#comments</comments>
		<pubDate>Tue, 03 Sep 2013 08:00:18 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Ciekawostki]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[algorytm]]></category>
		<category><![CDATA[czcionka]]></category>
		<category><![CDATA[Edward Snowden]]></category>
		<category><![CDATA[National Security Agency]]></category>
		<category><![CDATA[NSA]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[rozpoznawanie]]></category>
		<category><![CDATA[Sang Mun]]></category>
		<category><![CDATA[whistle blower]]></category>
		<category><![CDATA[znaki]]></category>
		<category><![CDATA[ZXX]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=312</guid>
		<description><![CDATA[<p>Wobec informacji ujawnionych przez Edwarda Snowdena o programie PRISM, nie jest niczym nowym, iż rozmaite organizacje rządowe zbierają o nas tyle informacji, ile tylko się da. Jednym to nie przeszkadza,</p>
<p>Post <a rel="nofollow" href="/zxx-sposob-na-przechytrzenie-nsa/">ZXX – sposób na przechytrzenie NSA</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Wobec informacji ujawnionych przez <strong>Edwarda Snowdena</strong> o programie <strong>PRISM</strong>, nie jest niczym nowym, iż rozmaite organizacje rządowe zbierają o nas tyle informacji, ile tylko się da. Jednym to nie przeszkadza, drudzy natomiast biją na alarm, iż ograniczane są podstawowe prawa i przywileje obywateli. Nikt natomiast nie lubi być podglądany, szczególnie w Internecie.</p>
<p>Agencją, która w największym stopniu śledzi życie obywateli w cyberprzestrzeni jest <strong>NSA</strong> – National Security Agency. <strong>Były agent</strong> NSA, Sang Mun, który przez dwa lata pracował w Korei  i miał okazję z pierwszej ręki dowiedzieć się jak wydobywa się cenne dane, postanowił się temu procederowi sprzeciwić. Opracował specjalny rodzaj czcionek, nazwanych ZXX (od trzyliterowego kodu wykorzystywanego w Bibliotece Kongresu, którym oznaczane są książki o statusie: „brak treści językowej; nie dotyczy”), które są <strong>nie do rozpoznania</strong>, nawet przy zastosowaniu najbardziej zaawansowanych mechanizmów OCR.</p>
<p><a href="/wp-content/uploads/2013/08/zxx-gif.gif"><img class="aligncenter size-full wp-image-317" alt="ZXX - mix" src="/wp-content/uploads/2013/08/zxx-gif.gif" width="394" height="197" /></a></p>
<h2>Jak działa ZXX?</h2>
<p>Spośród sześciu opracowanych czcionek ZXX, zeskanowane i rozpoznane mogą być tylko dwie. Pozostałe cztery: Camo, False, Noise i Xed uniemożliwiają programom Optical Character Recognition na odczytanie znaków z jakąkolwiek sensowną trafnością.</p>
<p><span id="more-312"></span></p>
<p>Cały trik polega na tym, iż do poszczególnych liter dodane są określone efekty, które z jednej strony nie pozwalają maszynie na poprawne rozpoznanie, a z drugiej nie są na tyle uciążliwe by nie mogły być odczytane przez człowieka. I tak:</p>
<p><img class="alignleft" style="font-size: 11px; line-height: 16.5px; margin: 5px;" alt="ZXX - Camo" src="/wp-content/uploads/2013/08/zxx1.png" width="80" height="102" /><strong>Czcionka Camo</strong> została skonstruowana w taki sposób, by zakamuflować „szkielet” tradycyjnego znaku. Dodane zostały różne owalne i nieregularne kształty, przypominające maskowanie na żołnierskich mundurach.</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p><img class="alignleft" style="margin: 5px;" alt="ZXX - False" src="/wp-content/uploads/2013/08/zxx2.png" width="80" height="102" /></p>
<p><strong>Czcionka False</strong> opiera się na zgoła innym założeniu. W tym przypadku w duże litery (fałszywe) wpisane są mniejsze (prawdziwe), co powoduje, że OCR odczytuje mniejszy znak, jako szum. Proste, lecz skuteczne.</p>
<p>&nbsp;</p>
<p>&nbsp;</p>
<p><img class="alignleft" style="margin: 5px;" alt="ZXX - Noise" src="/wp-content/uploads/2013/08/zxx3.png" width="80" height="102" /></p>
<p><strong>Czcionka Noise</strong> zawiera szumy w postaci kwadratów, które okalają dany znak. Każdy z nich został przetestowany pod kątem tego, jaką ilość szumów należy dodać, aby zmylić program skanujący. Okazało się, że litera „m”, jest najlepiej rozpoznawana i wymagała dodania największej ilości szumów.</p>
<p>&nbsp;</p>
<p><img class="alignleft" style="margin: 5px;" alt="ZXX - Xed" src="/wp-content/uploads/2013/08/zxx4.png" width="80" height="102" /></p>
<p><strong>Czionka Xed</strong> zawiera „iksy” w każdej literze i cyfrze, rozciągające się na całą powierzchnię znaku.  Dzięki temu OCR ma ogromne problemy z rozpoznaniem kształtu. Xed jest najskuteczniejszą z wszystkich czcionek, a w dodatku bardzo łatwą do odczytania przez ludzkie oko.</p>
<p>&nbsp;</p>
<p>Zmiksowanie wszystkich czterech powyższych typów zapewni natomiast najlepszy możliwy efekt, zmniejszając tym samym <a title="Skuteczny OCR w obiegu dokumentów" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint" target="_blank">skuteczność OCR</a>-a do wartości na granicy błędu statystycznego.</p>
<p>Więcej informacji w filmiku poniżej:<br />
<iframe src="http://player.vimeo.com/video/42675696" height="306" width="500" allowfullscreen="" frameborder="0"></iframe></p>
<h2>Zastosowanie czcionek ZXX</h2>
<p>Jak podaje autor, celem wykorzystania czcionek jest u<strong>możliwienie swobodnego przepływu informacji w sieci</strong>, z dala od oczu „Wielkiego Brata”. ZXX może omijać firewalle, a także służyć tzw. „whistle blowerom”, czyli ludziom tj. Edward Snowden, którzy ujawniają niemoralne i niezgodne z prawem praktyki organizacji rządowych i korporacji.</p>
<p>Jednakże, głównym celem stworzenia ZXX przez Sang Muna, jest <strong>zwiększenie świadomości społecznej</strong> i poważna debata dotycząca prywatności w sieci. To swego rodzaju manifest nawołujący do sprzeciwu wobec naruszenia podstawowych praw obywatelskich.</p>
<p>Na koniec należy zwrócić uwagę na jeszcze jeden fakt. Zastosowanie ZXX ma sens tylko w <strong>przypadku plików graficznych</strong> i ew. kopii papierowych. Z tego względu, że z punktu widzenia programistycznego zwykłe „a” to taki sam ciąg zer i jedynek jak „a” w ZXX czy każdej innej czcionce. Dlatego też w przypadku np. wpisu na blogu nie wymagany jest OCR by rozpoznać wszystkie znaki, gdyż zawierają one uniwersalne kodowanie. Ponadto nie ulega wątpliwości, iż kwestią czasu jest aż NSA przystosuje algorytmy swojego OCR do nowych, mylących czcionek. Dlatego póki co, mimo wszystko warto uważać na to co się w sieci umieszcza.</p>
<p>Post <a rel="nofollow" href="/zxx-sposob-na-przechytrzenie-nsa/">ZXX – sposób na przechytrzenie NSA</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/zxx-sposob-na-przechytrzenie-nsa/feed/</wfw:commentRss>
		<slash:comments>0</slash:comments>
		</item>
	</channel>
</rss>
