<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>OCR w dokumentach &#187; CAPTCHA</title>
	<atom:link href="/tag/captcha/feed/" rel="self" type="application/rss+xml" />
	<link>http://ocrwdokumentach.pl</link>
	<description>Jedyny, polski blog o Optycznym Rozpoznawaniu Znaków</description>
	<lastBuildDate>Wed, 12 Aug 2015 10:43:17 +0000</lastBuildDate>
	<language>pl-PL</language>
	<sy:updatePeriod>hourly</sy:updatePeriod>
	<sy:updateFrequency>1</sy:updateFrequency>
	
	<item>
		<title>CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</title>
		<link>http://ocrwdokumentach.pl/captcha-kontra-spam/</link>
		<comments>http://ocrwdokumentach.pl/captcha-kontra-spam/#comments</comments>
		<pubDate>Tue, 29 Oct 2013 12:07:03 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Ciekawostki]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[CAPTCHA]]></category>
		<category><![CDATA[CRAPTCHA]]></category>
		<category><![CDATA[ludzka farma]]></category>
		<category><![CDATA[łamanie]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[spam]]></category>
		<category><![CDATA[spambot]]></category>
		<category><![CDATA[webmaster]]></category>
		<category><![CDATA[zabezpieczenia]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=392</guid>
		<description><![CDATA[<p>Spam jest prawie tak stary jak Internet. Oprócz wirusów, trojanów, malware’u itp. jest największą plagą cyberprzestrzeni. Któż z nas nie dostał e-maila z reklamą cudownych tabletek na powiększenie męskiego&#8230; hardware’u</p>
<p>Post <a rel="nofollow" href="/captcha-kontra-spam/">CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Spam jest prawie tak stary jak Internet. Oprócz wirusów, trojanów, malware’u itp. jest największą plagą cyberprzestrzeni. Któż z nas nie dostał e-maila z reklamą cudownych tabletek na powiększenie męskiego&#8230; hardware’u :)? Od dekady jednym z najskuteczniejszych mechanizmów zabezpieczenia stron internetowych i forów dyskusyjnych jest wykorzystywanie (re)CAPTCHY. Jednak i ten mur udaje się rozbić, m.in. dzięki mechanizmom <strong>OCR</strong> &#8211; Optycznego Rozpoznawania Znaków.</p>
<p>Obecnie oprócz reklamowania szemranych produktów i usług, spam na stronach internetowych służy również m.in. do: manipulowania wynikami ankiet, masowego linkowania, rozprowadzania złośliwego kodu czy naruszania integralności kodu stron. Szacuje się, że aż <strong>90% wiadomości wysyłanych w Internecie to spam</strong>.</p>
<p>Od dekady jednym ze skuteczniejszych mechanizmów służących do obrony przed spamem jest <strong>CAPTCHA</strong> oraz jej pochodne tj. <a title="Czym jest RECAPTCHA?" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/" target="_blank">reCAPTCHA</a>. Pomysłowość osób rozsyłających spam sięga coraz dalej i nawet CAPTCHA niekiedy bywa zawodna. Zobaczmy jakie są 3 najczęstsze sposoby jej łamania:</p>
<p><span id="more-392"></span></p>
<h2>OCR</h2>
<p>Technologia Optical Character Recognition nieustannie się rozwija. Obecnie topowe rozwiązania potrafią rozpoznać 99% znaków w przypadku dokumentów o przyzwoitej jakości. Fakt ten nie umknął spamerom, którzy coraz częściej wykorzystują OCR do <strong>łamania kodów</strong> serwowanych przez CAPTCHE. W wielu przypadkach nawet szumy, zakłócenia i zniekształcenia to zbyt mało by przeszkodzić w rozpoznaniu znaków.</p>
<p>Obecnie wiele haseł serwowanych przez programy zabezpieczające jest tak trudna, że nawet ludzie mają problemy z jej rozpoznaniem. Wszystko wskazuje na to, że ciągłe udoskonalanie programów OCR doprowadzi do zmierzchu CAPTCHy, która swoim skomplikowaniem zniechęca wielu użytkowników do jej rozwiązywania i podejmowania wielokrotnych prób. Stworzono nawet mechanizm <a title="CRAPTCHA - impossible CAPTCHA" href="http://laughingsquid.com/crapcha-impossible-captcha-tests-that-prank-web-users/ " target="_blank">CRAPTCHA</a> stworzony do <strong>trollowania sfrustrowanych internautów</strong> poprzez przedstawianie znaków niemożliwych do przepisania.</p>
<p>Smutny jest niestety fakt, iż technologia, która powinna służyć pożytecznym i ambitnym projektom, tj. <strong>digitalizacja starych księgozbiorów</strong>, wykorzystywana jest do ułatwienia spamerom zaśmiecania sieci. Sytuacja ta przypomina nieco losy najsłynniejszego wynalazku Alfreda Nobla. Dynamit z założenia miał pomagać w rozwoju cywilizacyjnym, lecz po pewnym czasie został wykorzystany przeciwko cywilizacji.</p>
<p><a href="/wp-content/uploads/2013/10/suspicion.png"><img class="aligncenter size-full wp-image-394" alt="CAPTCHA zabija boty" src="/wp-content/uploads/2013/10/suspicion.png" width="551" height="167" /></a></p>
<h2>Ludzkie farmy</h2>
<p>Innym sposobem radzenia sobie z mechanizmami CAPTCHA jest tania siła robocza. Jak to działa? <strong>Spamboty</strong> próbując dostać się do danej strony internetowej napotykają na hasło do rozwiązania. Robią zrzut ekranu i wysyłają go do osób, które zdecydowały się za grosze (1-2$ dziennie) rozpoznawać tego typu tekst. Wprowadzenie takiego trybu działania w państwach zachodnich byłoby nieopłacalne ze względu na koszt pracy. Niestety wykorzystanie<strong> taniej siły roboczej</strong> z krajów tj. Indie, Pakistan czy Filipiny umożliwia zastosowanie tego typu metod. Ile to kosztuje? Za rozwiązanie 5000 CAPTCHY zapłacimy niecałe&#8230; 7 dolarów.</p>
<h2>Fałszywa CAPTCHA</h2>
<p>Szukasz w Internecie informacji. Aby uzyskać do niej dostęp musisz rozwiązać CAPTCHE. Wprowadzasz hasło. Źle. Drugi raz. Trzeci. Za czwartym wiesz już na pewno, że wprowadziłeś poprawne dane, a mimo to nie możesz przejść dalej. Właśnie <strong>stałeś się częścią darmowej ludzkiej farmy do rozpoznawania znaków</strong>. Mechanizm jest bardzo podobny jak w poprzednio omawianym przypadku, z tą różnicą że wykorzystuje nieświadomość użytkownika i podstawia mu kod, który tak naprawdę posłuży kolejnemu spambotowi.</p>
<p><a href="/wp-content/uploads/2013/10/constructive.png"><img class="aligncenter size-full wp-image-393" alt="Pożyteczne spamboty" src="/wp-content/uploads/2013/10/constructive.png" width="492" height="176" /></a></p>
<p>Zabezpieczenie cyberprzestrzeni staje się coraz trudniejsze dla webmasterów i coraz bardziej uciążliwe dla użytkowników.  <strong>Obecnie rozwiązanie CAPTCHY zajmuje około 15-20 sekund. To wystarczająco dużo, aby porzucić stronę.</strong> Szczególnie jeśli jedna próba nie wystarczy. Na rynku pojawiają się coraz nowsze rozwiązania. Wśród nich obiecująco zapowiadają się proste i interaktywne animacje, w których np. trzeba sportowcom przydzielić odpowiedni do zajmowanego miejsca medal.</p>
<p>Wszystko wskazuje na to, że <strong>wojna spamerów z webmasterami nigdy się nie skończy</strong>. Zmienią się jedynie narzędzia prowadzenia walki. Najwięcej ucierpią niestety cywile, czyli my – zwykli Internauci.</p>
<p>Komiksy pochodzą ze strony: xkcd.com</p>
<p>AKTUALIZACJA:</p>
<p>Z ostatniej chwili: w sieci pojawił się filmik, którego autorzy twierdzą, że złamali CATPCHę. Do obejrzenia (i poczytania) tutaj: http://www.wired.com/wiredscience/2013/10/captcha-busted/</p>
<p>Post <a rel="nofollow" href="/captcha-kontra-spam/">CAPTCHA kontra spam &#8211; czy OCR będzie kolejnym dynamitem?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/captcha-kontra-spam/feed/</wfw:commentRss>
		<slash:comments>2</slash:comments>
		</item>
		<item>
		<title>Jak digitalizujemy książki nawet o tym nie wiedząc?</title>
		<link>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/</link>
		<comments>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/#comments</comments>
		<pubDate>Fri, 11 Jan 2013 10:46:15 +0000</pubDate>
		<dc:creator><![CDATA[Michał Rykiert]]></dc:creator>
				<category><![CDATA[Jak działa OCR?]]></category>
		<category><![CDATA[Zastosowanie OCR]]></category>
		<category><![CDATA[archiwum]]></category>
		<category><![CDATA[CAPTCHA]]></category>
		<category><![CDATA[digitalizacja]]></category>
		<category><![CDATA[dokumenty]]></category>
		<category><![CDATA[internet]]></category>
		<category><![CDATA[książki]]></category>
		<category><![CDATA[Luis von Ahn]]></category>
		<category><![CDATA[Optical Character Recognition]]></category>
		<category><![CDATA[Pittsburgh]]></category>
		<category><![CDATA[reCAPTCHA]]></category>
		<category><![CDATA[skanowanie]]></category>
		<category><![CDATA[zabezpieczenie]]></category>

		<guid isPermaLink="false">http://ocrwdokumentach.pl/?p=109</guid>
		<description><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest reCAPTCHA. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></description>
				<content:encoded><![CDATA[<p>Jednym z najciekawszych i najbardziej pomysłowych rozwiązań na jakie się ostatnio natknąłem jest<strong> reCAPTCHA</strong>. Dzięki niej, miliony ludzi na świecie staje się swego rodzaju manualnym OCR-em, nawet o tym nie wiedząc. Jak to możliwe?</p>
<p>Rejestrując się na stronie lub na forum, zazwyczaj na koniec tego procesu witryna zmusza Cię do udowodnienia, że nie jesteś botem do rozpowszechniania <strong>spamu</strong>. Co robisz? W 90% przypadków przepisujesz kod/wyraz z wyświetlonego obrazka obrazka. Tak działa m.in. reCAPTCHA.</p>
<p>Jak to się ma do <a title="System OCR" href="http://www.webcon.pl/ocr-i-rejestracja-dokumentow-sharepoint">OCR-a</a>? Nawet najlepsze systemy nie są w stanie rozpoznać 100% skanowanych wyrazów. Obecnie skuteczność tego typu programów kształtuje się na poziomie 90-98%, w zależności od wykorzystywanych algorytmów i jakości skanowanego tekstu. To oznacza, że przy tekście zawierającym 20 000 słów, wciąż od 400 do 2000 pozostaje do rozpoznania przez człowieka.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA2.png"><img class="alignnone  wp-image-113" title="Błędne rozpoznanie systemu OCR" src="/wp-content/uploads/2013/01/reCAPTCHA2.png" alt="Błędne rozpoznanie systemu OCR" width="489" height="97" /></a></p>
<p><span id="more-109"></span></p>
<p>Tymczasem na <strong>Uniwersytecie Carnegie-Mellona w Pittsburghu</strong>, zastanawiano się jak szybko i małym nakładem sił można digitalizować książki i stare egzemplarze gazet. Tak powstał projekt reCAPTCHA. Mechanizm jest w gruncie rzeczy bardzo prosty. Użytkownik, by zakończyć np. rejestrację, musi przepisać dwa słowa podane przez program. W przypadku rozwiązania naukowców z Pittsburga, jedno z nich jest słowem kontrolnym (znanym przez system), natomiast drugie, to słowo nieprawidłowo rozpoznane przez moduł OCR.</p>
<p><a href="/wp-content/uploads/2013/01/reCAPTCHA.png"><img class="size-full wp-image-114 aligncenter" title="reCAPTCHA w praktyce" src="/wp-content/uploads/2013/01/reCAPTCHA.png" alt="reCAPTCHA w praktyce" width="341" height="185" /></a></p>
<p><strong>Kolejność wyrazów jest losowa</strong>, natomiast ich jakość zbliżona, dlatego internauta nigdy nie wie, które z nich stanowi zabezpieczenie. Jeśli dane słowo, przez różnych użytkowników, zostanie trzykrotnie jednakowo zweryfikowane, wówczas system przesyła je do źródła jako rozpoznane. W przypadku kiedy trzej pierwsi użytkownicy nie podali jednakowo brzmiących odpowiedzi, wówczas wyraz prezentowany jest większej ilości osób, a decyzja o jego ostatecznym brzmieniu podejmowana jest na podstawie najczęściej pojawiających się odpowiedzi. Skuteczność tej metody wynosi<strong> ponad 99,5%</strong>, co przy ilości rozpoznawanych słów jest wynikiem imponującym.</p>
<p>ReCAPTCHA funkcjonuje od 2009 roku i w pierwszych 12 miesiącach od wprowadzenia udało się zdigitalizować aż <strong>17 tysięcy książek</strong>. Szacuje się, że aż <strong>200 milionów kodów</strong> zabezpieczających CAPTCHA rozwiązywanych jest codziennie przez internautów na całym świecie. Proces ten zajmuje około 10 sekund, co daje sumarycznie niebagatelną ilość zrealizowanych <strong>150 tysięcy roboczogodzin</strong>, każdego dnia.</p>
<p>Geniusz reCAPTCHY leży w kilku czynnikach. Przede wszystkim jest to rozwiązanie podwójnie pożyteczne. Z jednej strony webmasterzy zabezpieczają swoje strony i fora internetowe przed spamem. Z drugiej, rozpoznawane są słowa, z którymi nie radzi sobie OCR. Natomiast najlepszy w tym wszystkim jest fakt, że odbywa się w to sposób niemalże <strong>niezauważalny i nie wymagający wysiłku</strong> dla pojedynczego użytkownika. A do tego wszystkiego, reCAPTCHE można zaimplementować bardzo łatwo i zupełnie <strong>za darmo</strong>. Czego chcieć więcej?</p>
<p>Nie wiem jak Wy, ale według mnie twórcy (<strong>Luis von Ahn</strong>, Ben Maurer, Colin McMillen, David Abraham i Manuel Blum) powinni na stałe wpisać się w kanon osób, które pożytecznie przyczyniły się dla społeczeństwa światowego. ReCAPTCHA codziennie pozwala na utrwalenie kilkudziesięciu książek, które w przeciwnym przypadku już nigdy mogłyby nie być dostępne dla szerszej publiki.</p>
<p>Post <a rel="nofollow" href="/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/">Jak digitalizujemy książki nawet o tym nie wiedząc?</a> pojawił się poraz pierwszy w <a rel="nofollow" href="/">OCR w dokumentach</a>.</p>
]]></content:encoded>
			<wfw:commentRss>http://ocrwdokumentach.pl/jak-digitalizujemy-ksiazki-o-tym-nie-wiedzac/feed/</wfw:commentRss>
		<slash:comments>26</slash:comments>
		</item>
	</channel>
</rss>
