登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
书本FAISSDB
书本FAISSDB
收藏
OpenDataLab
2026-07-12 更新
2024-05-09 收录
文本处理
信息检索
数据链接:
https://opendatalab.org.cn/Anooyman/EmoLLMRAGTXT
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
纯文本vectorDB
纯文本向量数据库(VectorDB)
应用场景:
提供机构:
Anooyman
创建时间:
2024-03-24
搜集汇总
数据集介绍
背景与挑战
背景概述
书本FAISSDB是一个公开的文本数据集,大小为48.3MB,包含19.1k个条目,适用于数据库文件、文本生成和自然语言理解等任务。
以上内容由遇见数据集搜集并总结生成
相关数据集
Income Text Utils API
文本处理
API工具
Text utility API with slug, clean, upper/lower, stats operations
RapidAPI
2025-12-10 更新
13
0
jkeisling/projectgutenberg-kokoro_v1-mimi
文本处理
语音识别
该数据集包含四个字段:整数序列的codes、规范化文本的text_normalized、音素序列的phonemes和说话者ID的speaker_id。数据集提供了一个训练集,包含300万个示例,总大小约为16GB。数据集适用于需要处理文本和音频数据的NLP和语音处理任务。
Hugging Face
2025-02-02 更新
8
0
jgov
电子政务
文本处理
e-Gov PDF Page Images with Text数据集包含了来自e-Gov Open Data门户的PDF文档的页面级渲染和提取的文本(非OCR)。文本是通过PDF的文本层提取的,没有嵌入文本的页面可能是空的。图像使用MuPDF以200 DPI渲染。该数据集遵循特定的生成规范,并使用CC-BY-4.0许可证。
Hugging Face
2025-09-16 更新
6
0
kienlc1/final_T5_train_data_splitted
机器学习
文本处理
--- dataset_info: features: - name: text dtype: string splits: - name: train num_bytes: 606403423 num_examples: 371985 download_size: 290860117 dataset_size: 606403423 configs:
Hugging Face
2024-06-06 更新
10
0
Replication Data for: Automatic Subject Indexing with Large Language Model Fine-tuning and Controlled Vocabulary Retrieval
自然语言处理
信息检索
Replication Data and Code for: Automatic Subject Indexing with Large Language Model Fine-tuning and Controlled Vocabulary Retrieval
DataONE
2025-10-30 更新
7
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广