37 миллионов старых газетных страниц выложены в Сеть
Опубликовано сб, 24/12/2016 - 09:19 пользователем DeMorte
Forums: Как создать самый большой архив периодики в домашних условиях? Американец Том Триниски просто вооружился сканером и взялся за дело в собственной гостиной. Работая в одиночку, Том Триниски сумел оцифровать более 37 миллионов страниц старых газет — это больше, чем в американской Библиотеке Конгресса (крупнейшая библиотека мира), — сообщает Newtonew. Результаты своего труда он выкладывает в открытый доступ на сайте Fulton History, где можно найти архивы более 1000 газет штата Нью-Йорк, некоторых других штатов и Канады. В архиве, который составитель регулярно обновляет, содержатся издания с 1795 по 2007 год. Триниски — инженер на пенсии и любитель старины. Над сайтом и контентом он работал в одиночку, в своём доме. Четырнадцать лет назад он решил отсканировать коллекцию старых открыток с видами округа Фултон, Нью-Йорк (его родной район), чтобы поделиться ими в интернете. Впоследствии к открыткам добавились заметки, рекламные объявления, некрологи, печатные издания. Ресурс до сих пор называется в честь округа Фултон, хотя материалы давно вышли за первичные географические границы. Для оцифровки газет используется программа для оптического распознавания символов, которая иногда ошибается из-за того, что некоторые издания очень старые. Также создатель сайта задействовал микрофильмы, на которых есть следы царапин и пыли, однако это добавляет старым газетным страницам обаяния. Сайт Fulton History не всегда справляется с наплывом гостей, и временно бывает недоступен из некоторых точек мира. Если такое случилось, можно заглянуть на Chronicling America, ещё один открытый ресурс с историческими газетами, на сайт с архивами газет от Бруклинской публичной библиотеки, или прошерстить базу данных Нью-Йоркской публичной библиотеки — здесь тоже есть множество старых изданий, и не только американских.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
aldan RE:Подайте бедному копеечку на книжку с литреса... 58 мин.
Isais RE:Издательство "Медуза" 2 часа Larisa_F RE:Серия «Интеллектуальный детектив» изд-ва АСТ 1 день edvud RE:Багрепорт - 2 4 дня sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 неделя babajga RE:Народные сказки - Сказки народов Сибири = Fairy-Tales of... 1 неделя Саша из Киева RE:Кто сможет раздобыть и оцифровать нужные мне книги? 1 неделя Kiesza RE:Бушков умер. 1 неделя sibkron RE:Серия "Библиотека французской литературы" (Макбел) 1 неделя Isais RE:Игорь Северянин - Том 2. Поэзоантракт 2 недели sem14 RE:Современная корейская литература. Книжная серия... 2 недели sem14 RE:Семейственность в литературе 3 недели Isais RE:Детство, опаленное войной (Вторая мировая 1939-1945 и ВОВ) 4 недели kopak RE:На 78-м году жизни скончался советский и российский... 1 месяц Саша из Киева RE:Подводное течение 1 месяц konst1 RE:Переименовать ник (имя учетки) 1 месяц Larisa_F RE:Таррин Фишер 2 месяца Aleks_Sim RE:Беженцы с Флибусты 2 месяца Впечатления о книгах
Олег Макаров. про Путилов: Постовой [СИ] (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
18 10 Феерически безграмотный текст. Просто невозможно читать Оценка: нечитаемо
lukyanelena про Сергей Васильевич Лукьяненко
18 10 Фантастический писатель Лукьяненко. Вроде и книги пишет с моралью, и метания главного героя всегда правильные высокоморальные... но как же бесит этот русский шовинизм, лезущий из всех щелей, просто ужас. И Украину обязательно ………
mixentiy про Ильичев: Ворожей Горин – Зов крови (Приключения: прочее, Городское фэнтези, Мистика, Самиздат, сетевая литература)
18 10 Многословно. Тот случай, когда диалоги и размышлизмы должны быть проще. Забавненько. Немного утомляют медицинские познания автора, вываливаемые на читателя к месту и совсем не. Но "специалист подобен флюсу" - суть ………
Isais про Руж: Авалон (Исторический детектив)
17 10 Цирк одного шоумена. Весь вечер на манеже фокусник! Показывает фокусы на вербальном материале, или лексическом уровне, или, проще говоря, на словах. Он и так умеет, и сяк умеет, и знает, как ментов называли в 1920-е, и Булгакова ……… Оценка: плохо
Дей про РОС: Граф Рысев
17 10 Сначала шло туго, меня бесил наглый, самоуверенный и хамоватый ГГ. Да и события развивались ни шатко, ни валко. А дальше автор стал выдавать текст всё лучше и лучше, что большая редкость. Понравилось.
Darja68 про Астахов: Чужая земля [litres] (Детективы: прочее)
15 10 Редкостная чушь. Куски текстов законов и введение в миграционную политику РФ вперемешку с с вялой интригой Оценка: плохо
Belomor.canal про Бохэннон: ЕВА. История эволюции женского тела. История человечества [litres] (История, Биология, Научпоп)
15 10 Масса впечатляющих фактов о том что есть и как есть у женщин и на сколько они другие существа, с точки зрения биологии и психологии. Очень рекомендую почитать читательницам библиотеки, хотя бы потому, что современная медицина ……… Оценка: отлично!
Wik@Tor про Стоев: Странные Земли (Фэнтези, Самиздат, сетевая литература)
14 10 Прочитал Срамные земли. Появился интерес, но тут же понял, что это Странные земли. Интерес пропал.
mysevra про Булычев: Спасите Галю! (Научная фантастика)
13 10 Прелесть какая! Приятно будоражит. Жутче и ярче, чем большинство книг по S.T.A.L.K.E.R. (хотя тут и не каноническая чернобыльская Зона, но тем не менее). И концовка такая, по-нашему, лишь бы было тихо. Оценка: отлично!
mysevra про Чуковский: Серебряный герб (Детская проза)
13 10 В старых книгах для подростков была заложена идея, как им стать полноценными членами общества и встроиться во взрослый мир. В современных книгах тинейджеры прогибают мир под себя, а глупые взрослые крутятся вокруг них. Надеюсь, ……… Оценка: отлично!
mysevra про Ефремов: Сердце Змеи [litres] (Космическая фантастика, Научная фантастика)
13 10 Хотела обновить воспоминания. И не вышло – хорошие идеи, плохой театр. Вообще большинство советской фантастики сейчас смотрится так, словно и у персонажей, и у рассказчика швабра с позвоночник зашита. Живые люди, которые вынуждены ……… Оценка: неплохо |
RE:37 миллионов старых газетных страниц выложены в Сеть
Вот это мужик! Респект и уважуха!
От будут ли правообгладатели ему втыкать за использование материалов?
RE:37 миллионов старых газетных страниц выложены в Сеть
Из FAQ_HELP_INDEX:
В. Могу я добавить статью на этот сайт?
О. Ага. Если газета была опубликована в штате Нью-Йорк и не попадает под копирайт...
===
И на первой странице:
Мери Крисмас, библиотекарь!
RE:37 миллионов старых газетных страниц выложены в Сеть
Ну если оно в сети, тогда и все смогут загребти себе. Вот и если начнется массовое пополнение библиотек газетами...
RE:37 миллионов старых газетных страниц выложены в Сеть
Что-то сильно я сомневаюсь что именно 37 млн страниц газет, скорее всего. как пишут в статистике больших библиотек "единиц хранения" - отдельных открыток, рекламных обьявлений и т.д.
Попробуем посчитать.
37 000 000 / 14 лет = 2 642 000 страниц в год / 365 дней = 7 241 страница в день /12 часов = 600 стр в час или 6 страниц в минуту.
Многовато выходит, и это чисто сканирование. + какая-никакая обрезка + каталогизация + выкладка в Сеть.
RE:37 миллионов старых газетных страниц выложены в Сеть
Дети помогали. Или еще кто то.
А какие там страницы, может не такие как у нас. Тогда по несколько страниц за проход.
RE:37 миллионов старых газетных страниц выложены в Сеть
А можно задать вопрос: вы сами пробывали сканировать газеты?
RE:37 миллионов старых газетных страниц выложены в Сеть
Нет.
Но при современному оборудовании много чего возможно.
RE:37 миллионов старых газетных страниц выложены в Сеть
Расчёт - правильный. В исходных статьях ещё написано, что дедуля в последние три года оцифровывает по 250 000 страниц в месяц - те же самые 6 страниц в минуту (если считать, что он работает 24 часа в сутки, не питаясь и не отлучаясь в туалет).
Я тоже заинтересовался гигантскими цифрами в заметке и немного посчитал. А потом полез на англоязычные сайты и все странности исчезли. Всё гораздо проще.
С бумажными газетами дед недолго поработал в самом начале проекта - в 2001-2003 годах, когда у него был только планшетный сканер.
После этого он приобрёл мощный автоматический сканер для обработки микрофильмов (Wicks and Wilson Scanstation production-level microfilm scanner), наладил взаимодействие с библиотеками и запустил поточное производство. Так что последние 14 лет он оцифровывал микрофильмы, а не сами газеты.
Работает дед по 70-80 часов в неделю, и его работа заключается в том, чтобы распаковать привезённые ему микрофильмы, вставить их в мощный сканер-автомат и получить на выходе готовые сканы, практически не требующие дополнительной обработки. Их сразу можно отправлять на сайт.
Так что основную работу проделали десятки библиотекарей, десятилетиями превращавшие бумажные газеты в микрофильмы. А дед пользуется результатами их титанического труда. Это, конечно, не умаляет его заслуг - но объясняет его небывалую для сканировщика "производительность"...
Подробности - здесь:
http://www.thecrowleycompany.com/long-time-client-uses-wwl-scanners-digitize-26-million-newspaper-images/