Вы здесьТипичные ошибки распознавания - собираем статистику для скрипта ФБЕ
Опубликовано чт, 06/01/2011 - 11:12 пользователем TaKir
Собираю статистику по наиболее частым типичным ошибкам распознавания для включения их в скрипт ФБЕ: Варианты: Прошу участвовать всех желающих. Дополненный список я хочу включить в недавно обновленный скрипт "Поиск по набору регэкспов", автор Sclex (http://groups.google.com/group/fiction-book-editor/browse_thread/thread/b4700ee54d255384), работающий под ФБЕ. Сейчас данный скрипт у меня ищет: Использование этого скрипта заметно сокращает время работы над книгой в ФБЕ.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Aliki RE:Подайте бедному копеечку на книжку с литреса... 2 часа
Isais RE:Детство, опаленное войной (Вторая мировая 1939-1945 и ВОВ) 3 дня sem14 RE:Современная корейская литература. Книжная серия... 6 дней sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 6 дней kopak RE:На 78-м году жизни скончался советский и российский... 2 недели Саша из Киева RE:Кто сможет раздобыть и оцифровать нужные мне книги? 2 недели Саша из Киева RE:Подводное течение 2 недели lemma7 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 2 недели konst1 RE:Переименовать ник (имя учетки) 3 недели Larisa_F RE:Таррин Фишер 1 месяц Aleks_Sim RE:Беженцы с Флибусты 1 месяц Саша из Киева RE:Как приобретать друзей и оказывать влияние на людей 1 месяц Isais RE:Семейственность в литературе 1 месяц miri.ness_ RE:Доступ 27 1 месяц bmusanov Оплатил, но абонемент не отображается 1 месяц holla RE:Багрепорт - 2 1 месяц konst1 RE:Файнридер для Win11 1 месяц larin RE:Оплатил, но абонемент не отображается 1 месяц Впечатления о книгах
obivatel про Номен: Олегархат им. тов. Сталина (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
24 09 Немного более сильно напрягает использование автором оборотов со словом "более". Если таким образом перефразировать т.Сталина, получится нечто типа "Жить стало более хорошо, жить стало более радостно". Надо полагать, автор ……… Оценка: неплохо
Никос Костакис про Конторович: За Державу обидно! [litres] (Альтернативная история, Боевая фантастика)
22 09 – Куда б ему деваться-то? Стонал, что твой Плюшкин! Гость вопросительно приподнял бровь. – Есть у нас такой литературный персонаж – патологически жадный и неопрятный тип, ростовщик! ___________________________________ Плюшкин - ростовщик??? Я впечатлен!
Barbud про Горнов: Ульян едет в Крым (Социальная фантастика)
22 09 Ерунда какая-то несусветная, ни о чем вообще. Начал читать, одолел чуток, честно пытаясь вчитаться - вообще не понял, зачем и о чем оно написано. Проскроллил дальше - там не лучше. Ниасилил, в общем. Оценка: нечитаемо
mysevra про Ночкин: Череп мутанта (Боевая фантастика)
22 09 О, эта часть более динамична, чем первая. И обложка красивая. Оценка: хорошо
mysevra про Подшибякин: Голодный мир [litres] (Ужасы, Мистика)
22 09 Во-первых, надоел мат, просто утомил, это уже не оригинально. Во-вторых, если вдуматься и представить себе всё это, то да, жутко, но персонажи такие отвратные, что как бы ждешь, чтобы их поскорее перемололо. И впечатление ……… Оценка: неплохо
mysevra про Нин: Генри и Джун (Эротика)
22 09 Жить в праздности, не заботиться ни о чём, кроме как о «раскрепощении и освобождении чувственности» - это так мило и восхитительно, что злит неимоверно. Злит даже не то, чем забита голова главной героини в то время, как другие ……… Оценка: плохо
obivatel про Номен: Внучь олегарха (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
21 09 Мне очень понравилось. Почитал комментарии и лишний раз убедился, что на вкус и цвет фломастеры разные. . И я к пятой главе понял, что за телеграмма пошла вначале сюжета. Хороший дедулька у бабушки был; жаль, что в ……… Оценка: отлично!
obivatel про Гросов: Инженер Петра Великого – 2 (Альтернативная история, Исторические приключения, Попаданцы, Самиздат, сетевая литература)
20 09 В общем, устал я читать этот бред. Автор не понимает простейших вещей и у меня большие сомнения, что он инженер: слишком много пробелов в знаниях. Эх, а ведь там аж куча томов, читать-не-перечитать. Но не для меня эта ягодка... волчья. Оценка: нечитаемо
obivatel про Гросов: Инженер Петра Великого – 1 (Альтернативная история, Исторические приключения, Попаданцы, Самиздат, сетевая литература)
19 09 Пока автор писал про плавку, про станки и инструмент, всё было гут. Но зачем он начал писать про военку, если ВООБЩЕ ничего не понимает? Проблема стрельбы круглым объектом из гладкоствола в неконтролируемом вращении снаряда ……… Оценка: плохо
obivatel про Жизнь Лекаря с нуля
18 09 Написано хорошим слогом, читать приятно. . Много логических противоречий, которые цепляют и раздражают; -- некоторые противоречия необходимы для "логики мира", но она от этого сильно прихрамывает; -- некоторые, ………
alexk про Шпаковский: Читающее Средневековье [litres] (Исторические приключения, История)
17 09 С картинками какая-то беда. То не те, то не там, то дубли...
Думает про Крашенинников: Наследники или ренегаты. Государство и право «оттепели» 1953-1964 [litres] (Политика, Юриспруденция)
17 09 Все романтики сгорели в сталинских лагерях. А те, что смогли оттуда выйти после войны - уже не были романтиками. Показателен в этом смысле кейс человека и его семьи, который укрывал Ленина в Финляндии (знаменитый шалаш в ……… |
Комментарии
Отв: Типичные ошибки распознавания - собираем статистику ...
Слова "оп, пи, опа" вообще-то существуют.Редко-редко, но они встречаются. Используя скрипт - рискуем их потерять.
Хотя... из той же области: па (на), Ас (А с), пет (нет)
Отв: Типичные ошибки распознавания - собираем статистику ...
Скрипт только ищет и выделяет подозрительное место курсором. Автозамена не планируется )
Отв: Типичные ошибки распознавания - собираем статистику ...
Пробелы перед знаками препинания, в начале и в конце абзаца. Отсутствие пробела вокруг тире. Несколько пробелов подряд.
Но это всё фигня, это поиском с regexp'ом лечится. А вот со слипшимися абзацами разобраться бы... Единственный более-менее хинт: если ни с того ни с сего после скана появляется разорванный в самом начале абзац, значит, одной-двумя строками выше точно два или более абзаца слиплись.
Отв: Типичные ошибки распознавания - собираем статистику ...
ив - и в (союз с предлогом)
ас - а с (то же)
оказал - сказал
опросил - спросил
Но эти случаи лучше проверять по бумажной книге.
Отв: Типичные ошибки распознавания - собираем статистику ...
...ьщик... => ...ыцик...
Отв: Типичные ошибки распознавания - собираем статистику ...
Тайме -- Таймс (и с маленькой буквы тоже)
Нуда -- ну да.
Кстати, концы строк без знаков препинания ищутся скриптом "Интерактивная ликвидация разрывов абзацев". Можно не дублировать.
Смесь букв с цифрами и неполный курсив/болд слова ищутся скриптом "Слипшиеся слова". Можно тоже не дублировать.
А что значит "неправильные дефисы-тире"?
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Ты когда им последний раз пользовался? И какой версией?
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Он давным-давно прерываем и очень удобно структурирован. Кроме того, можно показать спорное место перед принятием решения.
Обязательно поменяй на новую версию. Думаю, что он и под 2.4 будет работать.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вы, может быть, путаете "Интерактивную ликвидацию разрывов абзацев" со скриптом jurgennt'а "Разрыв предложения"? "Интерактивная ликвидация" - это которая в одно окно выводит цитаты сомнительных мест и для каждого сомнительного места - радио-кнопки с вариантами обработки (скриншот). И "Ликвидация" с самого начала была прерываемой.
(Ссылку на скачивание последней версии можно найти в этом топике (не в первом сообщении). А вот последняя версия на текущий момент.)
Отв: Типичные ошибки распознавания - собираем статистику ...
"Неправильные дефисы-тире" - это просто прилипшие дефисы.
типа -так
или- так
Генуборка их не убирает.
Скрипт "Интерактивная ликвидация разрывов абзацев" удобен просто для правки.
А быстрый поиск всех вхождений рваных абзацев очень быстро помогает искать и форматировать стихи, цитаты и проч. )
Так что одно другому не только не помеха, но и очень даже наоборот )
Скриптом "Слипшиеся слова" я пользуюсь, хотя что-то в нем мне не очень нравится... То ли его тормознутость и кажущаяся тяжеловесность, то ли еще что.
Стараюсь вычистить максимум без его участия, а потом уже контрольный в голову с его помощью )
Тайме -- Таймс - часто встречается, но я предпочел в ФР-словарь занести, когда столкнулся пару раз ) но включить можно, если не для книг про спорт )
Отв: Типичные ошибки распознавания - собираем статистику ...
Да, действительно, в спортивной книге можно проколоться. Но если ты говоришь, что он будет интерактивный, то, наверное, нестрашно. ;)
Насчёт тормознутости и тяжеловесности: надеюсь, ты последней версией пользуешься? Прерываемой и запускаемой с места курсора.
Отв: Типичные ошибки распознавания - собираем статистику ...
Я говорю, что он будет?
Он уже есть ) Как минимум несколько версий уже тестировалось, зря не пользуешься )
Просто вешается на хоткей (у меня F2) и показывает по очереди все проблемные места.
Окон никаких нет, просто курсор выделяет найденную кривизну, а уж что с ней делать - дело хозяйское )
Скрипт "Слипшиеся слова" последней версии у меня, но еще с первых версий не люблю это вечно убегающее в верхний угол окошко, стараюсь все, что можно, поправить сначала без помощи этого скрипта, ибо так быстрее получается )
Отв: Типичные ошибки распознавания - собираем статистику ...
Эээээ?!
А я? А я? А как же я? (с)
Кинь в меня ссылкой, пжалста.
upd:
Ой-ой-ой... *посыпает пеплом голову* Я поняла, о чём ты. О скрипте по регэкспам. Да, я им не пользуюсь. Что-то не заладилось. :(
А ты свои идеи просто туда добавляешь?
Отв: Типичные ошибки распознавания - собираем статистику ...
Ну да, собираю всякие явные косяки и пишу в этот скрипт.
И быстро кнопочкой по всей книге тынц-тынц-тынц...
Оченно облегчает жизнь, однако )
Можно создать несколько шаблонов этого скрипта и юзать по необходимости нужный из них, или быстро закомментировать какую-то строку или добавить еще что-то и на ходу продолжать проверку )
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Я тоже не очень поняла, как занесение в словарь помогает выловить эту ошибку.
Такир, объяснишь подробнее?
Отв: Типичные ошибки распознавания - собираем статистику ...
Если в словаре ФР нет слова Таймс, то он даже при хорошем качестве скана будет распознавать слово как Тайме. Почему именно тайме - хз.
Если слово занести в словарь и перераспознать текст - это слово по всему документу будет распознано как Таймс.
Точно так же в свое время я матюкался на слово лабрадор - есть полуостров Лабрадор, и есть порода собак - лабрадор (с маленькой буквы).
ФР знал только название полуострова, и тупо везде распознавал Лабрадор вместо лабрадор, хотя в тексте было с маленькой буквы и скан отличный..
Занес в словарь, и все стало как надо )
Отв: Типичные ошибки распознавания - собираем статистику ...
Убедительно! И с "лабрадором" я тоже постоянно удивляюсь, чего это оно постоянно с большой буквы.
Так и сделаю. Спасибо. :)
Отв: Типичные ошибки распознавания - собираем статистику ...
Я тебе в личку написал, но не уверен, что отправилось нормально...
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Джонс, Робертс - понятно почему...
Джон-Джона-Джоне-Джоном
Роберт-Роберте-Робертом
надо добавлять подобные имена в словарь ФР и указывать как склоняется )
Отв: Типичные ошибки распознавания - собираем статистику ...
Обидно только, что этап разборки с несловарными словами и неуверенно распознанными у меня наступает в самом конце - после отлова битых переносов, обработки слипшихся/порвавшихся абзацев и выискивания типовых кривораспознанностей. Придётся перепридумывать алгоритм обработки. :-(
Отв: Типичные ошибки распознавания - собираем статистику ...
ф - гр, ью - ыо
Отв: Типичные ошибки распознавания - собираем статистику ...
па - на
Отв: Типичные ошибки распознавания - собираем статистику ...
Их исправляет скрипт - СЛИПШИЕСЯ СЛОВА. Тем более его можно теперь остановить в любой момент. да и работает вроде шустро..
Отв: Типичные ошибки распознавания - собираем статистику ...
Ну, не то, чтобы исправляет, но хотя бы находит...
upd. и не находит, кстати...
скрипт "Слипшиеся слова" распрекрасно игнорирует подобные конструкции:
он- приобретет
легко переносит -утрату
Отв: Типичные ошибки распознавания - собираем статистику ...
На "он- приобретет", реагирует.
А на "переносит -утрату", нет.
Отв: Типичные ошибки распознавания - собираем статистику ...
Обязательно проглядываю вот эти штуки:
ыо - ью
иа - на
па - на
пе - не
ие - не
ке - не
оп - он
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо всем отозвавшимся!
Прилагаю свой дополненный скрипт, в который всегда можно добавить или убавить что-то еще.
Положить в папку Scripts ФБЕ, назначить на него любой удобный хоткей (сервис-настройки-клавиши-скрипты-«Поиск по набору регэкспов», присвоить нужную клавишу) и пользоваться.
http://narod.ru/disk/2874190001/Poisk_po_naboru_regexpov_TaKir.rar.html
Все добавленные мною регеспы помещены в теле скрипта между
// -------------начало блока TaKir - регэкспы:
// -------------конец блока TaKir - регэкспы:
// - строки закомментарены, т.е. не работают. Удобно для быстрого включения-выключения некоторых строк из скрипта. Правится в обычном блокноте.
Прошу желающих тестировать, отзываться и дополнять.
Еще раз спасибо Sclex, автору скрипта "Поиск по набору регэкспов" за очередную важную полезняшку! ))
Также спасибо Marina_Ch за помощь и тестирование скрипта и регэкспов
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
Еще можно искать "ббльш", "чтб", и прочие слова, в которых из "о" с ударением получается "б".
Отв: Типичные ошибки распознавания - собираем статистику ...
довольно часто, - пробел буква н пробел , на самом деле всегда буква и
и ещё довольно часто і является ! , или находясь в середине слова никакой нагрузки не несет
Отв: Типичные ошибки распознавания - собираем статистику ...
Данная ошибка выискиваются скриптом "слипшиеся слова".
Отв: Типичные ошибки распознавания - собираем статистику ...
добавлю букву н и остальные буквы, которые практически никогда не встречаются в окружении пробелов (типа ф, м, п, т...)
латинская i среди русских букв скриптом ловится.
Отв: Типичные ошибки распознавания - собираем статистику ...
В Публичной библиотеке Ершова как-то видел словари замен со словами с ошибками для программы CLTXT.
Отв: Типичные ошибки распознавания - собираем статистику ...
"совеем" вместо "совсем".
Отв: Типичные ошибки распознавания - собираем статистику ...
лее -> же
Отв: Типичные ошибки распознавания - собираем статистику ...
Буква "Ж" очень зависит от шрифта. Если жирный курсив с ней при распозновании творится что-то жуткое. :) Что угодно, только не "Ж".
Отв: Типичные ошибки распознавания - собираем статистику ...
Ага. В одной книжке "ж" постоянно распознавалось как "яс". Особенно хорошо слово "хуже" получилось :) Но "лее" чаще попадается.
Отв: Типичные ошибки распознавания - собираем статистику ...
ср - ф, ею - его
Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
В русском языке не так уж много слов с буквой "ф". Можно научить скрипт всем вариантам.
Отв: Типичные ошибки распознавания - собираем статистику ...
Поиск по морфологическому словарю нашел 30808 словоформ с буквой "ф". Для скрипта это слишком много.
Отв: Типичные ошибки распознавания - собираем статистику ...
Може быть есть возможность сделать выборку на сочетания, которые чаще брешут
-сф-фс-фё-ёф-рф-фр-фю-юф-фф-фы-ыф-фэ-
Как-то так примерно
И ещё, Скрипт показывает в фамилии с инициалами только инициалы. Это правильно? Г.К.Жуков
Отв: Типичные ошибки распознавания - собираем статистику ...
Нет. Правильно Г. К. Жуков.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вот и я о том. А скрипт вторую точку ( в Г.
К.Жуков игнорирует.Отв: Типичные ошибки распознавания - собираем статистику ...
Отв: Типичные ошибки распознавания - собираем статистику ...
http://rghost.ru/3908064
Страницы