Коллекции документов для тематического моделирования
Материал из MachineLearning.
(nips) |
(t\c) |
||
Строка 29: | Строка 29: | ||
'''Файлы:''' | '''Файлы:''' | ||
[[Media:RuDis-collection.rar|Архив RAR, 4.5 MБ]] | [[Media:RuDis-collection.rar|Архив RAR, 4.5 MБ]] | ||
- | * | + | * RuDisOld_t.txt — обучающая выборка |
- | * | + | * RuDisOld_c.txt — контрольная выборка |
'''Статьи:''' | '''Статьи:''' | ||
Строка 55: | Строка 55: | ||
'''Файлы:''' | '''Файлы:''' | ||
[[Media:NIPS-collection.rar|Архив RAR, 1.5 MБ]] | [[Media:NIPS-collection.rar|Архив RAR, 1.5 MБ]] | ||
- | * | + | * NIPSOld_t.txt — обучающая выборка |
- | * | + | * NIPSOld_c.txt — контрольная выборка |
'''Статьи:''' | '''Статьи:''' |
Версия 14:35, 7 июня 2013
|
Коллекции текстовых документов для экспериментов по тематическому моделированию.
Коллекция RuDis
Документы представляют собой коллекцию авторефератов диссертаций на русском языке.
Предварительная обработка: отбрасывание стоп-слов, лемматизация, формирование матрицы частот.
Все данные представлены в числовом виде, исходные тексты и словарь не прилагаются.
Элементами словаря являются отдельные слова (словосочетания не выделялись).
Длина словаря: 20211 слов.
Число документов: 2000 в обучающей выборке, 200 в контрольной выборке.
Разделение на обучающую выборку и контрольную — случайное.
Формат данных: заголовок коллекции содержит две строки:
число документов число слов в словаре
далее для каждого документа в файле записано по три строки:
число различных слов в документе идентификаторы слов через пробел, в порядке возрастания идентификаторов частоты соответствующих слов (сколько раз слово встретилось в документе) через пробел
Файлы: Архив RAR, 4.5 MБ
- RuDisOld_t.txt — обучающая выборка
- RuDisOld_c.txt — контрольная выборка
Статьи: [1]
Коллекция NIPS
Документы представляют собой статьи конференции NIPS на английском языке.
Предварительная обработка: отбрасывание стоп-слов, стемминг, формирование матрицы частот.
Все данные представлены в числовом виде, исходные тексты и словарь не прилагаются.
Элементами словаря являются отдельные слова (словосочетания не выделялись).
Длина словаря: 13649 слов.
Число документов: 1566 в обучающей выборке, 174 в контрольной выборке.
Разделение на обучающую выборку и контрольную — случайное.
Формат данных: тот же, что для коллекции RuDis
Файлы: Архив RAR, 1.5 MБ
- NIPSOld_t.txt — обучающая выборка
- NIPSOld_c.txt — контрольная выборка
Статьи: [1]
Литература
См. также
- Тематическое моделирование
- Вероятностные тематические модели (курс лекций, К.В.Воронцов). Текст: (PDF, 500 КБ). Презентация (PDF, 1 МБ).
- К.В.Воронцов. Научный семинар по вероятностным тематическим моделям, 23 апреля 2013. (PDF, 2.0 МБ).
- Лекция по латентному размещению Дирихле в рамках спецкурса БММО (PDF, 480 КБ).