Учёные факультета вычислительной математики и кибернетики МГУ разработали метод, позволяющий выявлять ошибки в размеченных текстах, используемых для обучения систем обработки языка.
Такие тексты представляют собой специальные корпуса, в которых для каждого предложения заранее указана его структура. Они используются при создании систем автоматического анализа языка, поэтому точность их разметки имеет ключевое значение.
В работе предложен подход, при котором на основе корпуса автоматически строится модель, способная воспроизводить его структуру. Если для одного и того же предложения система находит несколько вариантов разбора, это может указывать на возможные ошибки или неоднозначности в исходной разметке.
«Мы предложили способ, который позволяет автоматически находить потенциальные несоответствия в разметке и тем самым помогать экспертам быстрее их обнаруживать. Метод был протестирован на корпусе СинТагРус. В подмножестве из 8199 предложений система выявила 1148 случаев, где возможно несколько вариантов разбора. В большинстве из них — 1078 предложений — различия были связаны с разметкой запятых», — отметил доцент кафедры алгоритмических языков факультета ВМК МГУ Игорь Головин.
Разработанный инструмент не заменяет работу эксперта, но позволяет существенно сократить время анализа и сосредоточиться на наиболее проблемных местах в корпусе.
Подобные решения могут использоваться при подготовке языковых данных для систем искусственного интеллекта, где качество разметки напрямую влияет на точность моделей.
Результаты работы были представлены на научной конференции «Ломоносовские чтения».
