Интеллектуальный анализ больших данных

Узнать больше

iFORA и тонкости работы с Big Data на китайском языке

В чем заключаются специфика применения китайского языка в iFORA? Какие отличия машинного обучения на китайском языке от русского и английского языков? Эти и другие вопросы обсудили в новом выпуске подкаста Китайского клуба НИУ ВШЭ ведущая Мария Ефименко вместе с Марией Рахимовой, экспертом Центра стратегической аналитики и больших данных ИСИЭЗ и преподавателем Департамента зарубежного регионоведения ФМЭиМП.

iFORA и тонкости работы с Big Data на китайском языке

Мария Ефименко: Что такое большие данные, анализ больших данных и какова практическая применимость таких данных в китайском языке? Есть ли от этого профит и польза?

Мария Рахимова: Это автоматизированный сбор, парсинг с различных типов источников данных: медиа, научные публикации, патенты. Робот-парсер собирает информацию, и мы получаем, как правило, неструктурированные массивы – сотни тысяч и миллионы строк с текстами. Данные могут быть и структурированными, например, научные публикации с полями: автор, аффилиация, название, год, ключевые слова. Всё зависит от задачи: можно анализировать только метаданные (динамику публикаций по годам) или углубляться в содержание текстов. Так что большие данные – это огромные массивы информации из разных источников на разных языках.

Мария Ефименко: А какая разница в обработке европейского языка и китайского?

Мария Рахимова: Отличия принципиальные. Все зависит от цели: мы хотим выявлять именованные сущности (NER) или проводить сентимент-анализ – определение позитивной или негативной коннотации текста по словам-маркерам. Особенности китайского языка: во-первых, отсутствие пробелов между словами. В русском и английском мы ориентируемся на пробелы, чтобы выделять токены (слова или словосочетания), а в китайском всё «схлопнуто». Во-вторых, нет прописных и строчных иероглифов. В-третьих, многозначность и омонимия: даже 2-3 иероглифа могут сбивать машину при определении части речи. И ещё одна тонкость – имена собственные и заимствования: модель может пытаться анализировать смысл фонетических иероглифов, тогда как нам нужно только звучание.

Мария Ефименко: То есть с этими сложностями может справиться только человек с глубоким знанием языка?

Мария Рахимова: Да. Мы, кто долго изучал китайский, смотрим на эти сложности как на само собой разумеющееся. А вот модели машинного обучения выявляют эти уникальные отличия от русского и английского. Совладать с ними методологически может только человек, который владеет китайским на очень высоком уровне, чтобы все эти правила и особенности «скормить» модели при тренировке.

Почему это важно: преимущества аналитики Big Data на китайском языке

Владение инструментами анализа больших данных на китайском языке открывает доступ к мониторингу быстрорастущего азиатского региона, где Китай является ключевым экономическим и технологическим центром. Возможность обрабатывать китайскоязычные источники (рыночная аналитика и отраслевые медиа, научные публикации, патенты, экспертные доклады и так далее) позволяет:

  • оперативно отслеживать возникающие тренды в экономике, технологиях, экспертных и академических кругах.
  • получать информацию из источников, которые не дублируются на английском или русском языках.
  • принимать обоснованные решения, опираясь на локальную повестку, при формировании бизнес и государственной стратегии.

Таким образом, глубокая лингвистическая экспертиза в сочетании с методами машинного обучения становится стратегическим преимуществом для исследования новых рынков, возникающих трендов и перспективных технологий.

Полная запись подкаста доступна на платформах:

Яндекс Музыка
ВК Подкасты