iFORA и тонкости работы с Big Data на китайском языке

Мария Ефименко: Что такое большие данные, анализ больших данных и какова практическая применимость таких данных в китайском языке? Есть ли от этого профит и польза?
Мария Рахимова: Это автоматизированный сбор, парсинг с различных типов источников данных: медиа, научные публикации, патенты. Робот-парсер собирает информацию, и мы получаем, как правило, неструктурированные массивы – сотни тысяч и миллионы строк с текстами. Данные могут быть и структурированными, например, научные публикации с полями: автор, аффилиация, название, год, ключевые слова. Всё зависит от задачи: можно анализировать только метаданные (динамику публикаций по годам) или углубляться в содержание текстов. Так что большие данные – это огромные массивы информации из разных источников на разных языках.
Мария Ефименко: А какая разница в обработке европейского языка и китайского?
Мария Рахимова: Отличия принципиальные. Все зависит от цели: мы хотим выявлять именованные сущности (NER) или проводить сентимент-анализ – определение позитивной или негативной коннотации текста по словам-маркерам. Особенности китайского языка: во-первых, отсутствие пробелов между словами. В русском и английском мы ориентируемся на пробелы, чтобы выделять токены (слова или словосочетания), а в китайском всё «схлопнуто». Во-вторых, нет прописных и строчных иероглифов. В-третьих, многозначность и омонимия: даже 2-3 иероглифа могут сбивать машину при определении части речи. И ещё одна тонкость – имена собственные и заимствования: модель может пытаться анализировать смысл фонетических иероглифов, тогда как нам нужно только звучание.
Мария Ефименко: То есть с этими сложностями может справиться только человек с глубоким знанием языка?
Мария Рахимова: Да. Мы, кто долго изучал китайский, смотрим на эти сложности как на само собой разумеющееся. А вот модели машинного обучения выявляют эти уникальные отличия от русского и английского. Совладать с ними методологически может только человек, который владеет китайским на очень высоком уровне, чтобы все эти правила и особенности «скормить» модели при тренировке.
Почему это важно: преимущества аналитики Big Data на китайском языке
Владение инструментами анализа больших данных на китайском языке открывает доступ к мониторингу быстрорастущего азиатского региона, где Китай является ключевым экономическим и технологическим центром. Возможность обрабатывать китайскоязычные источники (рыночная аналитика и отраслевые медиа, научные публикации, патенты, экспертные доклады и так далее) позволяет:
- оперативно отслеживать возникающие тренды в экономике, технологиях, экспертных и академических кругах.
- получать информацию из источников, которые не дублируются на английском или русском языках.
- принимать обоснованные решения, опираясь на локальную повестку, при формировании бизнес и государственной стратегии.
Таким образом, глубокая лингвистическая экспертиза в сочетании с методами машинного обучения становится стратегическим преимуществом для исследования новых рынков, возникающих трендов и перспективных технологий.
Полная запись подкаста доступна на платформах: