Эволюция капчи: от теста Тьюринга до reCAPTCHA v3

Лекция была посвящена системе reCAPTCHA, выпущенной в релиз в мае 2007 года — с того момента, на секунду, прошло уже более 11 лет. Спустя менее чем два года после релиза систему выкупила компания Google, однако сумма прошедшей сделки неизвестна. Тогда заявлялось, что за счёт модернизации системы Google хочет оцифровать книги из своей коллекции Google Books. При этом оцифрованием будут заниматься пользователи, а не компания и её сотрудники. Да! Вот вы не задумывались, почему капча вылезает в виде текста?

Наверняка кто-то из вас считал, что это банальный набор слов, а даже если не считал так, то мог и не догадываться, что это всё — отрывки из книг, которые Google оцифровывает с помощью пользователей. Допустим, система до того уже расшифровывала какую-то книгу, но в силу ряда причин не смогла правильно определить, что написано в каком-то месте, и тут на помощь приходят пользователи: они получают капчу в виде текста, вводят его и проходят дальше. А Google получает оцифрованные фрагменты, раз за разом составляющие книгу. Как-то так это выглядит:

Прокрутите, чтобы посмотреть примеры поинтереснее.
Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #2
Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #3
Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #4
1 of 4
Прокрутите, чтобы посмотреть примеры поинтереснее.

В то же время, по словам спикера, Google решил запустить свои беспилотные автомобили. Чтобы машина не наломала дров в дороге и сама не превратилась в дрова, её нужно обучить распознавать объекты на дороге: дорожные знаки, другие машины, отличать автобус от пешехода и так далее. Но это не всегда корректно работало. Наверняка вы такое уже встречали, но вот вам, если вдруг позабыли:

Выберите все изображения, где изображены коммерческие грузовики / транспортные средства.
Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #6
1 of 2
Выберите все изображения, где изображены коммерческие грузовики / транспортные средства.
В начале доклада Сергей обратился к залу и спросил, кто знает, что такое reCAPTCHA — знают все. Чуть позже залу был задан вопрос: кто из них ненавидит капчу в принципе? Большинство опрошенных высказались о капче недовольно, большинство было слишком подавляющим, потому что руки в поддержку капчи подняли всего два человека.

Прежде чем появилась reCAPTCHA, была простая CAPTCHA — первые её образы появились в начале 2000-х годов. CAPTCHA расшифровывается как «Completely Automated Public Turing test to tell Computers and Humans Apart», что в переводе на русский значит: «Полностью автоматизированный публичный тест Тьюринга для различения компьютеров и людей». Основа современной капче была положена в 1950 году, когда английский математик Алан Тьюринг (это его тест) поставил себе задачу определить: может ли машина мыслить? Реализовал он эту задачу так: человек общался с компьютером и человеком виртуально. Задача человека — понять, кто с ним говорит: машина или человек, а задача машины — обмануть человека, чтобы тот сделал неправильный выбор. Подробнее об этом можно прочесть в Википедии.

Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #7

У капчей же смысл был не в том, чтобы запутать человека — наоборот, она должна была проверить, кто пользуется веб-сайтом: человек или бот. Для этого пользователю давали какую-нибудь задачу, например, картинку с искажённым текстом, который нужно прочесть и написать в поле. Если человек легко сможет прочесть такой текст, то машина — явно нет. Справедливости ради стоит отметить, что времена менялись, и позже боты научились расшифровывать текст капчи, поэтому появлялись различные её модификации.

Так зачем же нужна капча? По мнению докладчика, система помогает спасти бизнес: от спам-атак, когда боты могут зарегистрировать множество аккаунтов и начать рассылку спама: например, на форуме или в соцсети. Капча их останавливает. Конечно, она не защищает сайт от спама на 100 %. Та же ситуация и со скупкой билетов — один человек с помощью бота может закупить пачку билетов по одной цене, а затем продавать их в три раза дороже. Капча помогает избежать не только этого, но и DoS-атак на back-end.

Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #8

При всех плюсах системы нельзя забывать о том, что в ней есть минусы. Например, люди, которые плохо видят или не видят вообще, не смогут прочесть текст или решить пример. Тут на помощь им приходит аудиокапча — произносится какая-нибудь фраза, и пользователь должен понять, что это за фраза, и написать её. Но есть проблема: порой аудиокапча настолько нечёткая, что люди с первого раза не понимают, о чём там вообще говорится. Приходится слушать снова и снова. Однажды один из таких людей создал петицию на Change.org и адресовал её главам компаний Facebook, Google, Microsoft, eBay (ееееее бой), Yahoo!, Twitter и Yelp. Однако его петиция не набрала широкой поддержки (хотя её подписало 3 тысячи человек), но факт есть фактом — некоторым людям эта система мешает пользоваться интернетом.

Как уже говорилось выше, боты научились расшифровывать капчу. Сергей приводит интересную статистику: первую reCAPTCHA с первого раза решали 98 % ботов, а людей — всего 40. Именно поэтому в 2012 году была запущена вторая версия системы, где использовался метод распознания объектов на Street View. Облегчённая версия этой системы: пользователю требовалось только нажать на чекбокс, после чего система делала быструю проверку и выдавала окончательный вердикт: бот вы или нет. С помощью такой капчи система собирала все cookies от Google, а вместе с тем — информацию о нажатии кнопок, дату, язык устройства, а также о его браузерах и плагинах.

Эволюция капчи: от теста Тьюринга до reCAPTCHA v3, image #9

И ещё статистика:

100 миллионов reCAPTCHA решалось в день.
2,5 миллиона книг оцифровывалось в год с помощью пользователей reCAPTCHA.
Был ПОЛНОСТЬЮ оцифрован архив газеты The New York Times, которая выпускается с 1851 года (а всего более 13 миллионов статей).
Ну и, конечно же, все Google Books были оцифрованы.

Новая reCAPTCHA v. 3 была представлена в мае этого года на конференции для разработчиков Google I/O. На днях доступ к ней получили все разработчики.

В отличие от предшественников, новая версия — невидимая, то есть работает в фоне и незаметно для пользователя. Администраторы сайтов могут выгружать статистику по пользователям и смотреть, у какого пользователя какая оценка от 0 (скорее всего, бот) до 1 (скорее всего, человек). Владельцы сайта могут сделать так, что пользователям, чья оценка окажется ниже установленного значения, будет выдаваться капча. Если систему внедряют в сайт, но не вводят своих значений, она по умолчанию берёт значение 0,5 — то есть пользователям, которых оценили на 0,5 и ниже придётся пройти проверку. Как это устроено технически можно прочесть здесь.

В заключении можно отметить, что интерактивный мир двигается в сторону упрощения — в дальнейшем людям будет всё проще и проще пользоваться не только отдельными сервисами, но и технологиями в целом.

Андрей Бирюков, Илья Кораблев, Арсений Метелёв, Олег Андреев
специально для The Brown Room — независимого интернет-издания о социальных сетях и современных технологиях.

Больше интересных материалов — The Brown Room. Подписывайтесь и ставьте классы!
Больше интересных материалов — The Brown Room. Подписывайтесь и ставьте классы!
512 views·6 shares