登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
Flaglab/latam-xix-tagged-augmented
Flaglab/latam-xix-tagged-augmented
收藏
Hugging Face
2025-02-20 更新
2025-04-12 收录
数据链接:
https://hf-mirror.com/datasets/Flaglab/latam-xix-tagged-augmented
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
应用场景:
提供机构:
Flaglab
相关数据集
Flaglab/spanish-corpus-xix
语言研究
文本分析
这是一个关于19世纪西班牙语文本的语料库,包含报纸、书籍等多种类型的文本。数据集适用于多种自然语言处理任务,如填空、文本检索、文本分类等。数据集的大小在10万到1000万之间,来源包括扩展的BL书籍、拉丁美洲19世纪文本和古腾堡计划。
Hugging Face
2024-09-23 更新
18
0
Flaglab/latam-xix
历史文献
文本分析
--- annotations_creators: - no-annotation language: - es language_creators: - crowdsourced - machine-generated license: - mit multilinguality: - monolingual pretty_name: Latin-American XIX Century Spa
Hugging Face
2024-10-21 更新
13
0
Flaglab/econ-ie-spanish-ner
金融文本处理
实体识别
Econ-IE (Spanish NER)数据集是一个针对经济学领域影响评估的命名实体识别任务设计的西班牙语数据集,它是EconBERTA原始英语语料库的翻译和清洗版本。该数据集适用于训练和评估命名实体识别模型,并可用于跨语言转移实验以及科学西班牙语编码器的微调和基准测试。
Hugging Face
2025-11-10 更新
6
0
Spanish Corpus XIX
语料库
自然语言处理
该数据集是一个构建的语料库,包含了从1800年至1914年的古西班牙语文本,特别关注拉丁美洲的贡献。该语料库经过筛选和清洗,专门用于语义变迁检测任务。此外,该数据集还包括三个版本:原始版、清洗版和分块版,其中文本块不超过256个标记,以适应不同的语言模型。该数据集规模宏大,总标记数达到1300万。其任务是进行语义变迁检测(Semantic Shift Detection,简称Ssd)。
arXiv
15
0
Flaglab/academic-knowledge-abstracts-es
学术文献
文本分类
Academic Knowledge Abstracts数据集是由抓取哥伦比亚Rosario大学机构研究仓库的学术摘要而构建的。该数据集包含西班牙语学术摘要,并根据所属学院进行了标注。它可用于学术学科或学院的预测、西班牙语编码器的领域适应、科学西班牙语语料库的表示学习以及教育分析和机构知识建模等任务。数据集共有13,247条摘要记录,分为商业管理、医学、政府、法律、经济学和工程学六个学院类别。
Hugging Face
2025-11-10 更新
10
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广