Вы здесь(OMG!) Координация сканирования и вычитки - черт ногу сломает
Опубликовано пн, 05/08/2013 - 15:26 пользователем Psychedelic
Когда у меня есть свободное время, я сканирую\распознаю\верстаю fb2. Насколько я понимаю ЦЕЛЬ этой фичи - в том, чтобы быстро найти книжную работу - сканировать, распознать, вычитать, исправить битый fb2 итп. с регистрацией того, кто будет ее делать, а также для того, чтобы не пересекались работы, т.к. чтобы Вася не делал ту же книгу, что делает сейчас Петя. Возможно конечно преследовались другие цели, к примеру ТОЛЬКО сбор статистики работы - тогда да (сарказм), этот функционал полностью покрывает цель, т.к. сколько я не рылся, я видел только одну статистику - кто че сделал. Итак подробно: Первая ошибка в том, что фильтр (значение "любое" на все колонки) находит людей которые: Ок, давайте поиграемся с фильтром. Моя цель найти: 1. Готовый скан 2. Электронный текст НЕ в книжных форматах (doc, rtf). Итак после 5 минут трехэтажных натягиваний нервов (т.е. методом тыка, не того результата и снова тыка), я наконец понял как найти нужное.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
нэнси RE:Подайте бедному копеечку на книжку с литреса... 5 часов
Larisa_F RE:Серия "Я познаю мир" издательства "АСТ, Астрель, Олимп",... 1 день Larisa_F RE:Серия "Очень прикольная книга", издательство Азбука-классика 2 дня larin RE:Заблокирован 3 дня alexk RE:Прошу переформатировать, распознать, etc... 6 дней konst1 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 2 недели Larisa_F RE:Серия книг «Судьбы книг» издательства «Книга» 2 недели fixel RE:Пропал абонемент 2 недели sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 месяц sibkron RE:"100 славянских романов", серия изд.-ва "Центр книги... 1 месяц Larisa_F RE:Серия "Новые сказочные повести" издательство "Самовар" ... 2 месяца sem14 RE:Серия "Символы времени" издательства "Аграф" 2 месяца tvv RE:faq brainstorm =) 2 месяца Larisa_F RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 2 месяца larin RE:абонемент не обновлен 2 месяца sem14 RE:За иллюминатором (серия) - чего не хватает? 2 месяца sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 2 месяца Larisa_F RE:Книжная серия «Сlio» издательства "Евразия" 2 месяца Впечатления о книгах
mysevra про Вольнов: Ловчий желаний [litres] (Боевая фантастика)
05 04 Слишком витиевато на мой вкус. Много забавного, но лишнего, не по теме. Оценка: неплохо
mysevra про Каляева: Порождения войны (Альтернативная история, Героическая фантастика, Исторические приключения, Самиздат, сетевая литература)
05 04 Для меня самая мякотка в книге – загадка, возможность строить предположения и угадывать, что же за всем этим скрывается. А тут – хороший язык, яркие персонажи, месмеризм, опять же, но той самой загадки нет, всё на поверхности. Вот это для меня минус. Оценка: хорошо
mysevra про Пинтер: Симулятор убийств [litres] (Детективная фантастика, Триллер, Детективы: прочее)
05 04 Не скажу, что я в восторге, но, в принципе, неплохо. Оценка: неплохо
udrees про Каменистый: Убийца легенд (Боевая фантастика, Фэнтези, Попаданцы, ЛитРПГ)
05 04 Отличное продолжение приключений попаданца в теле аристократа. Написано живо, красочно, с оттенками юмора, без всяких пошлостей. В книге хватает сражений с самыми разными противниками, для которых подбирается своя тактика. ……… Оценка: отлично!
udrees про Володин: Газлайтер. Том 13 [СИ] (Альтернативная история, Боевая фантастика, Фэнтези, Попаданцы, Самиздат, сетевая литература)
05 04 Дурацкая книга о слишком сильном телепате-школьнике, вчера закончившем школу, но успевшем стать супербизнесменом, приближенным Царя, еще и в другом мире захватил пару королевств, женился на 4-х девушках, одна из них не-человек, ……… Оценка: плохо
udrees про Хендерсон: Книга о самых невообразимых животных. Бестиарий XXI века [litres] [IThe Book of Barely Imagined Beings: A 21st Century Bestiary ru] (Биология, Научная литература: прочее)
05 04 Я не очень понял по какому принципу автор отбирал животных для своей книги, я думал тут будут интересные факты о необычных животных, ну ладно там аксолотль. Но тут сборная солянка, все идет по алфавиту и видимо для соответствия ……… Оценка: плохо
udrees про Макнилл: Моргенштерн (Боевая фантастика, Эпическая фантастика)
05 04 Просто пьеса, как у Шекспира и других. Никаких почти действий. Коротенький рассказ-пьеса, где примарх и Ариман идут и разговаривают. Не скажу что было интересно читать. Оценка: неплохо
udrees про Френч: И настала полночь [ЛП] (Боевая фантастика)
05 04 Неплохой рассказик о ночи накануне великого сражения за Дворец Императора. Хорошо показано висящее напряжение, прям как 22 июня 1941 года. Ожидание конечно действует сильнее самого сражения. Оценка: неплохо
udrees про Вальтер: Браконьер 3 (Боевая фантастика, Приключения: прочее, Постапокалипсис, Самиздат, сетевая литература)
05 04 «Ещё год назад я и понятия не имел, что такое боли в спине.» - вот это отрадно читать. Чувствуется что писатель явно не школьник и более менее обладает житейским опытом. Сама книга довольно интересная, написана в том ……… Оценка: хорошо
Yuriko про Кусков: В Россию с любовью (Героическая фантастика, Фэнтези, Самиздат, сетевая литература)
04 04 Поверил аннотации автора, что эта книга - "лютый бред". Не буду читать.
Sello про Хемлин: Третья мировая Баси Соломоновны (Современная проза)
04 04 Свести к общему знаменателю абсолютно разнородные тексты, что, в общем-то, понятно, не получается. Понравились рассказы Аксенова, Вронского (особенно) и мемуарец о Леснёве Сергея Юрского. Абсолютно остался мной не понятым ……… Оценка: хорошо
tvv про Лотош: Одинокие искры над бездной (Космическая фантастика, Социальная фантастика, Самиздат, сетевая литература)
03 04 Текст третьей книги на сайте автора, http://lotosh.1gb.ru/txt/5-03 call of the infinity.htm |
Комментарии
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1) Оно, конечно, караул, но не караул-ужас-убивают. Гуманитарий (то бишь я) с двух пинков находит. Если не лень.
2) А варианты? Т.е. спасибо, что поделились эмоциями, но... других межсайтовых сервисов по информированию о верстке fb2 что-то не наблюдается. Будет где-то более удобная, дружелюбная и неглючная страничка с такой инфой - все будут ходить туда, http://lib.rus.ec/ocr тихо увянет; но пока же нет(?).
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Длинно как-то все.
Есть, наверно, минусы в координации. Почему бы не предложить решение по улучшению?
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Основная мысль сервиса: "я купил, покупаю, сканирую книгу. Ребята, если вам это интересно, то сообщаю об этом, можете не тратить деньги на эту же книгу, а купить другую. Но если вам нефиг делать, то покупайте такую же, фиг с вами, дублируйте мою работу". Деньги сэкономить и друг друга не дублировать - основная мысль. А по всем интересующим вас вопросам вы можете списаться в личку с человеком, нафигачившим статусы в карточке.
Отличный сервис, вообще-то. Чего не устраивает - не вкурил.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Хороший сервис, если разобраться:) Вообще можно поиграться ещё со ссылками напротив позиций: Книги в работе, Заказы, Статусы.
Например, нужны нулевые карточки без статусов. Смотрим позицию - Заказы, жмем, например, По поступлению и вуаля - http://lib.rus.ec/ocr/null
Получили список нулевых карточек. Можно и другие ссылки напротив позиции "Заказы" понажимать. Фильтры это для карточек со статусами.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Мысль хорошая, но этого не было в ТЗ при создании сервиса.
Обычно решалось и решается в личке. Без ОМГ и громких стенаний на форуме.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
А искать книги не в текстовых форматах для конвертации вообще не тут нужно. Они в книгах уже, и можно выбрать любой файл, скачать и конвертнуть. Если конечно его еще не конвертнули до.
Я в основном достаю и сканирую книги. И мне удобнее оставить статус, а не файл. Увидев статус Отсканировал, чел придет ко мне в личку и я адресно пошлю ему сканы. А не вывалю в пространство инета в надежде, что кто-нибудь когда-нибудь их возьмет в работу.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
1. Не надо вываливать куда-то. Нужно просто залить pdf\djvu (или на худой конец 7z пак с jpeg картинками, по размеру он еще меньше pdf) на либрусек в список книг автора - это в идеале.
Кстати ежедневно на либрусек заливается куча pdf книг. Найти их можно через поиск, логично и необходимо чтобы КСВ был связан с такими файлами. Человек интуитивно подразумевает связь с файлами сканов, когда видит КСВ.
Обращаться к кому то, чтобы выслали скан - это долго (пока человек прочитает, ответит, зальет - в среднем мин. сутки), у большинства свободное время есть сейчас, когда он зашел на либрусек, в поисках файла для работы (выходные например), вечером или завтра его уже может не быть.
А что с системой координации какая то другая надежда появляется? :) Все тоже - "в надежде что кто-нибудь когда-нибудь их возьмет в работу".
Понятно что КСВ+ файлы намного удобнее -- упорядоченная статистика с заявками + удобство работы и приоритеты (кто -то попросил вычитать fb2 или распознать pdf итп ) - чтобы работы не пересекались, иначе надежды нет.
Имхо тогда нужно написать так: Координация сканирования и вычитки (только статистика)..
Еще раз:
На данный момент эта фича реально полезна только тем, кто достает, они могут отследить заявки, выполнить их и отметиться - остальным же (сканировать\распознать\вычитать\сверстать) — только трата времени для добавления своей статистики в КСВ.
Трата - потому что средняя, ненаучная книга (с готового хорошего скана) делается за вечер (включая программную вычитку). Поэтому смысла регистрироваться на распознавание там нет.
Но КСВ служил бы хорошей системой для поиска приоритетных книг, которые нужно распознать\исправить (для поиска заявок).
P.s. Кстати, тот кто достает книгу, обычно ее и сканирует. Имхо пункты Достать\сканировать нужно объеденить, также как и пункты "могу достать" и "достаю".
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я обычно сканирую книги, судьба которых мне не безразлична. Стало быть, если долго не найдется желающий забрать сканы, я сделаю их сама. Опять же, отдавая сканы одному человеку, я почти уверена, что книгу сделает он. Оставляя их в сети/библиотеке, я не знаю, кто их взял, взял ли кто. Многим (в т.ч. мне) лень отмечаться в карточках, так вполне возможна ситуация, что несколько человек скачают мои сканы и будут делать задвоенную работу. В общем, мне нравится так, как сейчас, с небольшими недостатками, но в целом все устраивает.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Напомню еще раз: в первую очередь, сервис создан для удобства и минимизации трат времени/денег сканировщиков, а не для тех, кто хочет "вотпрямщас" что-нибудь вычитать.
Чаще всего пдф остается сырым полуфабрикатом, потому-что книги на вычитку берут или уже распознанные, или в сканах. Перераспознавать пдф заново занятие бессмысленное и глупое. То-же самое можно сказать о выкладывании сырых пдф и сканов в библиотеку(откуда они обязательно расползутся по сети.) С таким же успехом можно выкладывать невычитанные фб2 болванки сразу из ФайнРидера...
Естественно я не имею в виду те книги которые предназначены для выкладки в пдф.
Если кто-то хочет вычитать книгу - он маякнет в личку. Нет - значит ему это не так важно.
К тому же в координации участвует много других библиотек, и существующий порядок вещей, может быть и неидеальный, всех устраивает. Делать все красиво и удобно лично для вас , никто не будет.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
+500!
Это была основной идеей, и она отлично работает.
Желающие конвертировать/вычитывать могут воспользоваться инструментами по закладке Статистика.
Выбрав тип файла, можно найти книги для конвертирования (если целесообразно).
Выбрав оценку файла, можно найти книги для вычитки.
Или заглянуть на Максиму:
Список запросов на конвертацию
Список запросов на вычитку
Файлы, как правило, в обеих библиотеках идентичные.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Я может вас удивлю, большинство сканов художки в pdf\djvu - это именно не распознанный pdf, в pdf его собирают для удобства - чтобы сканы были в одном файле, и все сканы можно быстренько смотреть.
Наоборот распознавать в худ книге текст сохраняя его в отдельном слое в контейнере pdf -- это глупое занятие если вы делаете так, не делайте, - вы тратите свое время.
Т.к. во первых этот распознанный текст все равно не вытащишь без слитых абзацев, потерянного курсива, жирности и сносок(FineReader во время распознавания сноски определяет автоматом, и сохраняет их в fb2 как сноски) .
Во вторых распознают его тяп-ляп, "по-бырику", полагаясь на автомат, без шаблонов обучения и подстройки под язык - короче с кучей ошибок.
Поэтому в любом случае (что со слоем текста, что без) pdf, будущий fb2\epub итп, все равно нужно распознавать.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Вы мне прямо глаза открыли...
Давайте я вас тоже удивлю. Текст из пдф можно не вытаскивать. Можно (та-даам!) прямо из ФР сохранить его в в любом другом формате с сохранением форматирования, курсивов, сносок и т.д. А пдф остается лишь подспорьем.
Впрочем, делайте так, как привыкли.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Ага-ага.
Сам Adobe Acrobat не может толково сохранить текст ИЗ pdf без искажений (абзацы), а все потому, что исходный текст (текстовый слой) там, как правило, делается полностью на автомате (без вычитки, без курсива и жирности, без размеров шрифтов и цвета.)
А нужен текстовый слой pdf для того (и он задумывался для этого), чтобы скопировать кусок текста в буфер.
Да кстати, даже если бы текстовый слой извлекался идеально, с курсивами без ошибок, без слитых абзацев, то остаются еще проблемы, который все перечеркивают -- сноски придется делать вручную, и главное - в текст добавляется нумерация страниц и колонтитул (надпись вверху-внизу с названием книги и автора). Искать их и удалять вручную оч. долго и нудно.
P.s. Сними галочку в FR с "Автоматически распознавать" - она по дефолту включена. Когда забрасываешь pdf он сразу анализируется и распознается (именно с картинки, не со слоя). Включи "Отключить анализ и распознавание".
Потом загрузи текстовый pdf и попробуй сохрани в текстовый формат и удивись в второй раз.
Отв: (OMG!) Координация сканирования и вычитки - черт ногу ...
Дался вам этот пдф...
Мы, вроде, о сервисе координации говорили, не?