Perevod-Online.Com Языки, страны и перевод

Машинный перевод: как он устроен и чего от него ждать

Коротко: современный машинный перевод не подставляет слова по словарю, а собирает предложение заново на другом языке. Отсюда и его сильные стороны, и его характерные ошибки — те, которые невозможно заметить, не зная оригинала.

Эта страница объясняет устройство. Конкретные решения с их характеристиками — в справочнике: что можно запустить у себя и что переводит в облаке.

Почему перевод — это не подстановка слов

Потому что одна и та же мысль в разных языках распадается на слова по-своему, и порядок у них свой. Русское «мне холодно» по-английски становится «I am cold» — появляется подлежащее, которого в оригинале нет, и глагол-связка, который русскому не нужен. Обратной операции «слово за слово» здесь не существует: соответствие идёт не между словами, а между целыми конструкциями.

Первые системы перевода работали именно правилами и словарями: разобрать предложение по частям речи, найти соответствия, собрать обратно. На близких языках и в узкой предметной области это работало, но каждое исключение приходилось описывать отдельно, а исключений в живом языке больше, чем правил.

Следующее поколение считало вероятности по параллельным текстам: если в переводах рядом с одной фразой обычно стоит другая, значит они соответствуют друг другу. Стало заметно лучше, но система по-прежнему работала кусками в несколько слов и не видела предложение целиком — отсюда знаменитая рассогласованность падежей и родов в середине длинной фразы.

Как устроен нейросетевой перевод

Нейросетевой переводчик читает предложение целиком и только потом начинает писать перевод. Внутри он превращает исходный текст в набор чисел, где близкие по смыслу слова оказываются рядом, а затем порождает перевод слово за словом, каждый раз оглядываясь на весь исходный текст сразу.

Механизм, который делает это возможным, называется вниманием: порождая очередное слово перевода, модель заново решает, на какие части оригинала сейчас смотреть. Поэтому немецкий глагол, уехавший в конец предложения, встаёт в русском переводе на своё место — модели не нужно, чтобы порядок совпадал.

Отсюда же главное ограничение. Такой переводчик обычно работает по одному предложению. Он не знает, что было абзацем выше, и не помнит, как перевёл термин на прошлой странице. Если в тексте важно, кто такой «он» и мужчина это или женщина, машина выберет вариант по умолчанию — и будет уверенно повторять его весь документ.

Чем отличается перевод большой языковой моделью

Языковая модель переводит не как отдельная услуга, а заодно с остальной работой: тем же запросом её можно попросить пересказать текст, объяснить трудное место или выдержать заданную терминологию. И она видит документ целиком, а не по одному предложению, поэтому связность между абзацами ей даётся естественно.

Платить приходится другим. Специализированный переводчик обучен ровно одной задаче и делает её предсказуемо; языковая модель — универсальна, и это значит, что она может заодно подправить текст: сгладить резкую формулировку, дописать вежливость, привести цифру к «красивому» виду. В переводе договора или инструкции такая самодеятельность опаснее, чем шероховатый стиль.

Есть и практические различия, которые видно прямо в паспорте решений: у сервисов перевода цена считается за символы, у языковых моделей — за токены, отдельно за то, что вы отправили, и за то, что получили. И список поддерживаемых языков разработчики языковых моделей, как правило, не объявляют вовсе, тогда как у переводчиков он опубликован и машиночитаем.

Что происходит с текстом, который вы отправили

Это самый практичный вопрос и единственный, на который можно ответить точно: у каждого сервиса написано в его же документации. Разброс тут больше, чем принято думать — от «не храним и не обучаемся» до «храним, пока у вас есть аккаунт», причём у одного и того же разработчика бесплатный и платный тариф могут отличаться именно этим.

Поэтому в справочнике поле «что делает с вашими текстами» стоит у облачных решений первым, и рядом с ним — дословная цитата с официальной страницы, ссылка и дата, когда мы это прочитали. Пересказ своими словами здесь не годится: разница между «не используем для обучения» и «не используем без вашего согласия» решает всё, а на слух она почти не слышна.

Если текст нельзя показывать никому — вопрос закрывается сам собой: модель, запущенная у себя, никуда его не отправляет. Цена этого решения — железо, место на диске и время на настройку.

Что такое качество перевода и почему его нельзя оценить на глаз

Нельзя, потому что по одному примеру видно только этот пример. Переводчик, который блестяще справился с вашей пробной фразой, может рассыпаться на длинном тексте, на редкой паре языков или на терминологии вашей отрасли — и наоборот. Впечатление «этот переводит лучше» почти всегда основано на двух-трёх предложениях, а различие между системами проявляется на тысячах.

Профессиональная оценка устроена иначе. Берут набор текстов с эталонными переводами, прогоняют через системы и считают меру совпадения. Самая известная такая мера сравнивает совпадающие цепочки слов с эталоном; более новые вместо подсчёта слов сравнивают смысл, оценивая перевод другой нейросетью, обученной на человеческих оценках. У любой из них есть общее свойство: число имеет смысл только вместе с набором текстов, на котором оно получено. То же число на другом наборе будет другим.

Именно поэтому у нас на сайте нет ни оценок качества, ни рейтингов. Своих замеров мы не делаем — это отдельная и недешёвая работа. Чужие без ссылки на публикацию, версию модели и дату не приводим: без этого число выглядит убедительно и не значит ничего. Всё, что стоит в справочнике, проверяемо: лицензия, вес, языки, цена, обращение с текстами — и у каждого значения указано, откуда оно взято.

Оценить перевод для своей задачи можно и без замеров, и это честнее любого рейтинга: возьмите свой типичный текст — не рекламную фразу, а настоящий абзац со своей терминологией, — прогоните через два-три кандидата и дайте прочитать тому, кто знает язык. Ответ будет про вашу задачу, а не про среднее по больнице.

Что из этого следует при выборе

Развилка всего одна, и она не про качество. Если текст можно отправлять наружу, а возиться с настройкой некогда — облачные решения: там смотрят на цену, форматы документов и условия обращения с текстами. Если текст показывать нельзя или объём такой, что помегабайтная оплата разорит, — своё железо: там смотрят на лицензию, вес модели и на то, какие языки она вообще знает.

Для второго случая есть подборщик: язык, лицензия и вес — три вопроса, после которых остаётся короткий список. Он работает по тому, что можно проверить, и намеренно ничего не советует сверх этого.