Классификация, кластеризация и оценка сходства текстов (Курс "Компьютерная лингвистика") [Архэ] [Александр Пиперски]

Kors

Администратор
Регистрация
12 Дек 2014
Сообщения
195.103
Реакции
246.029
**Складчина: Классификация, кластеризация и оценка сходства текстов (Курс "Компьютерная лингвистика") [Архэ] [Александр Пиперски]**

**Компьютерная лингвистика** — одна из наиболее динамично развивающихся областей, сочетающая теорию и практику. Ежедневно мы используем достижения этой области: машинный перевод, поиск в сети, голосовые помощники и многое другое. За каждым таким продуктом стоит серьезная работа лингвистов и программистов. В рамках курса рассмотрим историю компьютерной лингвистики, популярные методы и их применение в решении практических задач, таких как проверка орфографии или классификация новостей по темам.

**Тема 7. Классификация, кластеризация и оценка сходства текстов**

Одной из важных задач компьютерной лингвистики является группировка похожих текстов. Это может быть как разделение на заранее заданные категории (например, «Спорт», «Политика»), так и обобщение на основе сходства содержания. Например, новостные агрегаторы сначала объединяют похожие тексты в один материал, а затем относят его к определенной категории. На занятии обсудим методы оценки расстояния между текстами, различия между классификацией и кластеризацией, и способы решения таких задач.

**Лектор:**
Александр Чедович Пиперски, кандидат филологических наук, доцент Института лингвистики РГГУ, научный сотрудник Школы филологии НИУ ВШЭ.
 
Сверху