登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
IndicFinNLP: Financial NLP for Indian Languages
IndicFinNLP: Financial NLP for Indian Languages
收藏
kaggle
2024-06-03 更新
2024-06-08 收录
金融NLP
印度语言学
数据链接:
https://www.kaggle.com/datasets/sohomghosh/indicfinnlp-financial-nlp-for-indian-languages
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
Financial Natural Language Processing for Indian Languages
针对印度语言的金融自然语言处理
应用场景:
创建时间:
2024-06-03
相关数据集
CFLUE
金融NLP
语言模型评估
CFLUE是一个专为评估大型语言模型在金融领域中文理解能力而设计的基准数据集。该数据集由阿里巴巴集团和苏州大学计算机科学与技术学院共同创建,包含超过38,000个多选题和16,000多个测试实例,涵盖文本分类、机器翻译、关系提取、阅读理解和文本生成等多种NLP任务。CFLUE旨在通过这些任务全面评估模型的性能,特别是在金融知识评估和应用评估方面。数据集的创建过程涉及从公开渠道获取的模拟考试题目和专
arXiv
2024-05-17 更新
346
0
MILU
自然语言理解
印度语言学
MILU(Multi-task Indic Language Understanding Benchmark)是由AI4Bharat创建的综合性评估基准,旨在填补评估大型语言模型在印度语言能力方面的空白。该数据集涵盖8个领域和42个主题,跨越11种印度语言,包括科学、数学、艺术、法律等多个领域。数据集通过从印度各地区和州级考试中收集问题创建,确保了文化相关性和地域特色。MILU的应用领域广泛,旨在
arXiv
2024-11-05 更新
53
0
karam1533/guj_ocr
印度语言学
文本识别
该数据集名为IndicSTR12,用于印度语场景文本识别。数据集包含三个主要特征:image_id(图像ID)、image_description(图像描述)和image(图像)。数据集分为三个部分:train(训练集)、valid(验证集)和test(测试集),分别包含400,000、100,000和100,000个样本。数据集的下载大小为873,904,395字节,总大小为471,952,48
Hugging Face
2024-12-01 更新
11
0
AI4Bharat-IndicNLP Dataset
自然语言处理
印度语言学
AI4Bharat-IndicNLP数据集是一个持续努力创建的,针对印度语言的大规模、通用领域语料库集合。目前,它包含来自两个语系10种印度语言的27亿个单词。该数据集提供预训练的词嵌入,并创建了9种语言的新闻文章分类数据集以评估这些嵌入。
github
2024-05-08 更新
141
0
ILSUM/ILSUM-1.0
文本摘要
印度语言学
ILSUM-1.0数据集旨在为印度语言的自动文本摘要任务提供可重用的语料库。该数据集涵盖了印地语、古吉拉特语和印度英语,每个语言提供约10,000篇新闻文章。数据集的独特挑战在于代码混合和脚本混合现象,即新闻文章中常借用英语短语。数据字段包括id、文章、标题和摘要。数据分为训练集、验证集和测试集。
Hugging Face
2023-07-26 更新
23
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广