Незнакомый иероглиф: сначала сохранить наблюдение, потом искать
Иероглиф на вывеске, в PDF или на фотографии не обязан немедленно превращаться в перевод. Если неизвестно произношение, попытка подобрать его по звучанию почти всегда ведёт в сторону: звук ещё не установлен, а похожих слогов и знаков много. Надёжнее идти от того, что действительно видно. Зафиксируйте сам знак, соседние два-три знака, место в строке, вариант письма и носитель. Эта маленькая пауза сохраняет информацию, которую легко потерять, когда вы начинаете открывать десяток поисковиков.
Цель поиска тоже надо назвать честно. Иногда нужен кодовый знак, чтобы скопировать его в заметку. Иногда — чтение, значение именно в слове, традиционная или упрощённая пара, источник цитаты или проверка того, не перепутала ли камера два похожих иероглифа. Один инструмент не отвечает на все вопросы. Хороший результат — не «похожий символ», а воспроизводимая цепочка: вот исходное изображение, вот распознанный знак, вот словарная статья и вот контекст, который подтверждает выбор.
Четыре маршрута поиска
Первый маршрут — рукописный ввод. Он удобен, когда знак виден достаточно крупно. На телефоне или в словарном приложении нарисуйте иероглиф пальцем; на планшете можно использовать стилус. Не обязательно повторять каллиграфию идеально, но структура должна быть различима: левый компонент не должен сливаться с правым, а длинная черта — с несколькими короткими. Получив кандидаты, не нажимайте первый. Сравните их с образцом по компонентам и числу деталей.
Второй маршрут — поиск по радикалу и чертам. Он медленнее, зато учит смотреть на строение. Выделяют предполагаемый ключ, считают оставшиеся черты и просматривают список. Трудность в том, что граница «ключа» не всегда очевидна, а подсчёт зависит от словарной системы. Поэтому метод особенно хорош как контроль после рукописного распознавания, а не как наказание за незнание чтения.
Третий — распознавание текста на изображении, или OCR. Оно быстро переносит строку с фотографии, но уверенность алгоритма не равна достоверности. Для крупной печатной надписи OCR может дать копируемый знак за секунду; для вертикальной строки, старого шрифта, блика или рукописи — переставить, пропустить либо заменить деталь. О том, как проверять такой результат, подробнее сказано в материале о китайском OCR.

Четвёртый — поиск по компоненту, описанию или изображению. Он помогает, если нельзя рисовать знак: например, осталась размытая фотография, а виден характерный элемент. Описание вроде «слева вода, справа что-то похожее на 青» не является идентификацией, но позволяет составить список гипотез. Затем каждую гипотезу проверяют не переводом, а точным сравнением с оригиналом.
Как читать форму, а не угадывать силуэт
Новичок часто помнит «общий рисунок» и видит сходство там, где различие принципиально. Привычка раскладывать знак на части снижает риск. Посмотрите, что занимает левую, правую, верхнюю и нижнюю позицию; есть ли огибающая рамка; где пересекаются черты; есть ли точка, крюк, дополнительный штрих. Не все элементы несут самостоятельное значение, но это не мешает использовать их как координаты для визуальной сверки.
Сравнивайте пары, а не одиночки. Например, 请 и 清 имеют общий компонент 青, но слева у них разные ключи: 讠 и 氵. Если камера ошиблась, именно этот небольшой участок решает, идёт ли речь о «просить» или о «чистом». 末 и 未 различаются длиной горизонтальной черты; 日 и 目 — внутренним устройством. Эти примеры не требуют зазубривания списка «опасных двойников»: они показывают рабочую технику — проверять место, направление и отношение черт, а не впечатление от значка.
Контекст как фильтр, а не как доказательство
Соседние знаки помогают сузить выбор. На упаковке рядом с числом вероятнее встретится единица измерения, в адресе — название места, в меню — название блюда. Но контекст не даёт права «дорисовать» то, чего на фото нет. Если на табличке в музее вы предполагаете название династии, а один знак неразборчив, помечайте его как неустановленный и храните исходный кадр. В исследовательской заметке такая честность ценнее гладкого, но выдуманного чтения.

Полезно захватывать не один знак, а маленький фрагмент: два знака слева и справа, строку целиком либо заголовок с подписью. Многие иероглифы меняют чтение или смысл в составе слова. Изолированная карточка может перечислить несколько чтений, тогда как соседний знак сразу указывает на устойчивое словосочетание.
Пошаговый протокол для фотографии и печатного текста
- Сохраните оригинальное изображение и сделайте копию для обрезки. Не повышайте резкость на единственном экземпляре: фильтр может создать ложную черту.
- Обрежьте область с одной строкой, выровняйте её и увеличьте без агрессивного сглаживания. Убедитесь, что не отрезали соседний компонент.
- Попробуйте OCR или рукописный поиск, но перепишите два-три кандидата в черновик, а не только первый.
- Сравните каждого кандидата с исходником по компонентам и чертам. Если различие есть, кандидат исключается даже при «подходящем» переводе.
- Откройте словарную статью для оставшегося знака или, лучше, для всего слова. Сверьте чтение, часть речи и контекст.
- Запишите результат вместе с уровнем уверенности: «проверено по строке», «вероятно», «нужен более чёткий снимок». Для цитаты сохраняйте ссылку или координаты источника.
Этот протокол кажется медленным только в начале. Он экономит время на второй попытке: вы не возвращаетесь к фотографии через неделю с вопросом, почему в заметке оказался именно этот иероглиф и откуда взялся перевод.
Когда поможет Unicode Unihan
База Unihan консорциума Unicode полезна как справочный слой, а не как разговорный словарь. Её поиск позволяет искать идеографы по выбранным свойствам, в том числе по определению или чтению Mandarin; для каждого знака в стандарте собраны разные типы данных. Это удобно, если надо уточнить кодовую точку, варианты, число черт в конкретной системе или увидеть, какие чтения и словарные индексы вообще фиксируются.
Но поле базы не заменяет живой словарной статьи. Английское определение там может быть кратким, исторические и региональные сведения — неоднородными, а частотность не обязана говорить о современном употреблении. Поэтому разумный порядок такой: Unihan помогает подтвердить сам знак и его технические свойства, затем учебный или корпусный словарь объясняет слово в контексте. Для одного редкого знака это особенно важно: «существует в Unicode» и «уместен в вашей фразе» — разные утверждения.

Сценарий: знак на вывеске
Представим фотографию вывески, снятую под углом. Первое действие — не переводить весь кадр, а выпрямить небольшую область и рассмотреть знаки по очереди. Если один из них похож на 店, не спешите заключать, что это магазин: сравните внутреннюю часть и верхнюю крышу. Затем попробуйте распознать всю пару или тройку. Словарь может показать устойчивое название заведения, а карта или официальный сайт — подтвердить реальное написание. Если подтверждения нет, в подписи к фото лучше оставить транскрипцию только для установленной части.
Сценарий: иероглиф в PDF или старом скане
В PDF знак может быть не картинкой, а текстом. Попробуйте выделить его мышью и скопировать в простую заметку. Затем вставьте в поисковую строку словаря и в поле Unihan. Если при копировании получается иной символ, квадрат или пустота, не делайте вывод, что источник «написан неверно»: возможно, в документ встроен нестандартный шрифт, слой OCR или повреждённая кодировка. Сверьте визуальный слой и скопированный код; статья о квадратах вместо иероглифов помогает диагностировать такой случай.
Со старым сканом другая проблема: форма может отличаться от современного печатного стандарта. Не стоит подменять неизвестный вариант похожим современным знаком без пометы. Ищите публикацию целиком, каталог издания, комментарий редактора, а при серьёзной филологической задаче обращайтесь к профильному изданию. Массовый OCR хорош для навигации по документу, но не для автоматической нормализации каждой графической детали.
Что делать, если несколько сервисов не согласны
Расхождение — полезный сигнал. Не выбирайте сервис с самым уверенным интерфейсом. Вернитесь к исходному пикселю: видна ли спорная черта? Может ли её закрывать блик? Имеется ли вертикальная подпись, которая меняет ориентацию? После этого разделите варианты на те, что визуально невозможны, и те, что остаются. Для оставшихся проверьте употребление словосочетания в надёжном источнике: официальной странице организации, полном тексте книги, качественном словаре.

Если решить невозможно, это нормальный результат поиска. В рабочем файле можно написать «[неразборчивый знак, вероятно ...]» и приложить вырезку. Нельзя только превращать предположение в чистовой перевод. Особенно осторожно обращайтесь с именами людей, лекарств, адресов, юридическими формулами и надписями на архивных предметах: цена одной неверной черты там существенно выше, чем в учебном упражнении.
Небольшой набор инструментов без зависимости от одного приложения
- Телефонный рукописный ввод — для быстро видимого, но не прочитанного знака.
- Поиск по радикалу и чертам — для медленной независимой проверки формы.
- OCR — для извлечения строки из хорошо снятого печатного материала.
- Словарь — для чтения, значения, слова и примеров употребления.
- Unihan — для технических данных, вариантов и проверки самого идеографа.
- Исходное изображение и контекст — для возможности перепроверить вывод позднее.
Не надо устанавливать все программы сразу. Достаточно одного удобного словаря, системной рукописной клавиатуры и привычки сохранять источник. Остальные маршруты подключаются, когда первый не дал уверенного ответа.
Проверка результата
До того как вставить найденный знак в конспект, проверьте три вещи. Во-первых, совпадает ли его форма с исходником, включая малые черты. Во-вторых, проверяли ли вы слово целиком, а не отдельный знак. В-третьих, можете ли вы через месяц объяснить, откуда взялся этот вариант. Если на любой вопрос ответ «нет», оставьте помету о неуверенности. Такой подход не замедляет изучение китайского; он создаёт привычку отличать знание от правдоподобной догадки.
Справки
Поиск идеографов по свойствам и краткое описание доступных полей приведены на странице Unicode Unihan Database Search. Для ввода знака по известной форме на macOS можно использовать добавляемые китайские источники ввода, описанные в руководстве Apple.
