跳到主要内容

🆕 免费可用数据集

预训练

OSCAR,即 Open Super-large Crawled ALMAnaCH coRpus,是一个大规模多语言语料库,通过 goclassy 架构对 Common Crawl 语料库进行语言分类和过滤后得到。数据按语言分发,同时提供原始版本和去重版本。

Hugging Face 上的 OSCAR 多语言语料库huggingface.co

Wikipedia 数据集包含所有语言经过清洗的百科文章。该数据集基于 Wikipedia dump 构建,每种语言对应一个数据切分。每条样本包含一篇完整的维基百科文章内容,并已清洗去除 markdown 标记与无关章节(如参考文献等)。

Hugging Face 上的 Wikipedia 数据集huggingface.co

微调

iapp_wiki_qa_squad 是一个基于泰语维基百科文章的抽取式问答数据集。它由 iApp Technology 将原始的 iapp-wiki-qa-dataset 转换为 SQuAD 格式而成,共包含来自 1529/191/192 篇文章的 5761/742/739 个问题。

Hugging Face 上的 iapp_wiki_qa_squad 数据集huggingface.co

thaiqa_squad 是一个开放领域的抽取式问答数据集(train 中有 4,000 个问题,dev 中有 74 个问题),采用 SQuAD 格式。该数据集最初由 NECTEC 基于维基百科文章创建,并由 PyThaiNLP 转换为 SQuAD 格式。

Hugging Face 上的 thaiqa_squad 数据集huggingface.co

ThaiSum 是一个大规模泰语文本摘要语料库,采集自 Thairath、ThaiPBS、Prachathai 和 The Standard 等多个在线新闻网站。该数据集包含超过 350,000 组由记者撰写的文章与摘要配对。

Hugging Face 上的 ThaiSum 摘要数据集huggingface.co

不良评论语料库

Thai UCC Corpus 由 PyThaiNLP Translator 与 Google Translator 从 UCC(Unhealthy Comments Corpus)翻译而来。

Hugging Face 上的 Thai-UCC 数据集huggingface.co