遇见数据集

do-me/SemanticFinder

收藏
Hugging Face2024-05-03 更新2024-03-04 收录
官方服务:

资源简介:

该数据集包含了多个文本文件的索引,这些文本文件包括原始文本、文本块及其嵌入向量。数据集中的文件涵盖了多种语言的文学作品、报告、法规等,如《资本论》、《神曲》、《唐吉诃德》等。这些文件可以导入到SemanticFinder中进行语义搜索。

该数据集包含了多个文本文件的索引,这些文本文件包括原始文本、文本块及其嵌入向量。数据集中的文件涵盖了多种语言的文学作品、报告、法规等,如《资本论》、《神曲》、《唐吉诃德》等。这些文件可以导入到SemanticFinder中进行语义搜索。

提供机构:
do-me
原始信息汇总

数据集概述

该数据集是为SemanticFinder应用准备的索引文本数据,包含原始文本、文本块及其嵌入信息。数据集中的文件详细信息如下:

数据集目录

文件大小 文本标题 作者 年份 语言 URL 模型名称 量化 分割参数 分割类型 字符数 块数 避免词(全部) 检查词(全部) 避免词(任意) 检查词(任意) 导出小数位数 行数 文本备注 文本来源URL 文件名
100.96 Collection of 100 books Various Authors 1890 en https://do-me.github.io/SemanticFinder/?hf=Collection_of_100_books_dd80b04b Xenova/bge-small-en-v1.5 True 100 Words 55705582 158957 2 1085035 US Public Domain Books (English) https://huggingface.co/datasets/storytracer/US-PD-Books/tree/main/data Collection_of_100_books_dd80b04b.json.gz
4.78 Das Kapital Karl Marx 1867 de https://do-me.github.io/SemanticFinder/?hf=Das_Kapital_c1a84fba Xenova/multilingual-e5-small True 80 Words 2003807 3164 5 28673 https://ia601605.us.archive.org/13/items/KarlMarxDasKapitalpdf/KAPITAL1.pdf Das_Kapital_c1a84fba.json.gz
2.58 Divina Commedia Dante 1321 it https://do-me.github.io/SemanticFinder/?hf=Divina_Commedia_d5a0fa67 Xenova/multilingual-e5-base True 50 Words 383782 1179 5 6225 http://www.letteratura-italiana.com/pdf/divina%20commedia/08%20Inferno%20in%20versione%20italiana.pdf Divina_Commedia_d5a0fa67.json.gz
11.92 Don Quijote Miguel de Cervantes 1605 es https://do-me.github.io/SemanticFinder/?hf=Don_Quijote_14a0b44 Xenova/multilingual-e5-base True 25 Words 1047150 7186 4 12005 https://parnaseo.uv.es/lemir/revista/revista19/textos/quijote_1.pdf Don_Quijote_14a0b44.json.gz
0.06 Hansel and Gretel Brothers Grimm 1812 en https://do-me.github.io/SemanticFinder/?hf=Hansel_and_Gretel_4de079eb TaylorAI/gte-tiny True 100 Chars 5304 55 5 9 https://www.grimmstories.com/en/grimm_fairy-tales/hansel_and_gretel Hansel_and_Gretel_4de079eb.json.gz
13.52 Iliad Homer -750 gr https://do-me.github.io/SemanticFinder/?hf=Iliad_8de5d1ea Xenova/multilingual-e5-small True 20 Words 1597139 11848 5 32659 Including modern interpretation https://www.stipsi.gr/homer/iliada.pdf Iliad_8de5d1ea.json.gz
1.74 IPCC Report 2023 IPCC 2023 en https://do-me.github.io/SemanticFinder/?hf=IPCC_Report_2023_2b260928 Supabase/bge-small-en True 200 Chars 307811 1566 5 3230 state of knowledge of climate change https://report.ipcc.ch/ar6syr/pdf/IPCC_AR6_SYR_LongerReport.pdf IPCC_Report_2023_2b260928.json.gz
25.56 King James Bible None en https://do-me.github.io/SemanticFinder/?hf=King_James_Bible_24f6dc4c TaylorAI/gte-tiny True 200 Chars 4556163 23056 5 80496 https://www.holybooks.com/wp-content/uploads/2010/05/The-Holy-Bible-King-James-Version.pdf King_James_Bible_24f6dc4c.json.gz
11.45 King James Bible None en https://do-me.github.io/SemanticFinder/?hf=King_James_Bible_6434a78d TaylorAI/gte-tiny True 200 Chars 4556163 23056 2 80496 https://www.holybooks.com/wp-content/uploads/2010/05/The-Holy-Bible-King-James-Version.pdf King_James_Bible_6434a78d.json.gz
39.32 Les Misérables Victor Hugo 1862 fr https://do-me.github.io/SemanticFinder/?hf=Les_Misérables_2239df51 Xenova/multilingual-e5-base True 25 Words 3236941 19463 5 74491 All five acts included https://beq.ebooksgratuits.com/vents/Hugo-miserables-1.pdf Les_Misérables_2239df51.json.gz
8.67 List of the Most Common English Words Dolph 2012 en https://do-me.github.io/SemanticFinder/?hf=List_of_the_Most_Common_English_Words_0d1e28dc Xenova/bge-small-en-v1.5 True
Regex 210518 25322 2 25323 GitHub Repo https://raw.githubusercontent.com/dolph/dictionary/master/popular.txt List_of_the_Most_Common_English_Words_0d1e28dc.json.gz
15.61 List of the Most Common English Words Dolph 2012 en https://do-me.github.io/SemanticFinder/?hf=List_of_the_Most_Common_English_Words_70320cde Xenova/multilingual-e5-base True
Regex 210518 25322 2 25323 GitHub Repo https://raw.githubusercontent.com/dolph/dictionary/master/popular.txt List_of_the_Most_Common_English_Words_70320cde.json.gz
0.46 REGULATION (EU) 2023/138 European Commission 2022 en https://do-me.github.io/SemanticFinder/?hf=REGULATION_(EU)_2023_138_c00e7ff6 Supabase/bge-small-en True 25 Words 76809 424 5 1323 https://eur-lex.europa.eu/legal-content/EN/TXT/PDF/?uri=CELEX:32023R0138&qid=1704492501351 REGULATION_(EU)_2023_138_c00e7ff6.json.gz
0.07 Universal Declaration of Human Rights United Nations 1948 en https://do-me.github.io/SemanticFinder/?hf=Universal_Declaration_of_Human_Rights_0a7da79a TaylorAI/gte-tiny True
Article Regex 8623 63 5 109 30 articles https://www.un.org/en/about-us/universal-declaration-of-human-rights Universal_Declaration_of_Human_Rights_0a7da79a.json.gz

数据集示例

在SemanticFinder中加载后,大约需要2秒钟即可在整个圣经中进行搜索。您可以尝试以下步骤:

  1. 点击您选择的示例URL之一。
  2. 索引加载后,输入您想要搜索的内容并点击“查找”。结果将几乎立即显示。

创建SemanticFinder文件

  1. 像往常一样使用SemanticFinder并至少运行一次搜索,以便创建索引。如果输入较大,这可能需要一些时间。例如,使用200个字符索引圣经会产生约23k个嵌入,使用量化的gte-tiny模型需要15-30分钟。
  2. 添加元数据(以便其他人可以找到您的索引)并导出文件。请注意,您可以自由减少小数位数以减小文件大小;通常3个足够,但根据模型可能需要更多。
  3. 如果您希望将其添加到官方集合中,请在此处创建PR!只需确保运行create_meta_data_csv_md.py一次以更新csv/md文件。目前,readme.md表需要手动更新meta_data.md。

隐私

  • 此仓库是公开的,共享公共利益文档或公共领域文档。
  • 如果您有敏感文档,仍然可以使用SemanticFinder创建索引并在本地使用。您可以每次从磁盘加载索引,或者在本地网络中托管并在SemanticFinder中添加URL。

使用案例

标准用例

在任何文本中搜索最相似的单词/句子/段落/页面。想象一下,CTRL+F可以找到相关单词,而不仅仅是您使用的完全相同的单词!如果您反复处理相同的文本,可以保存索引并重复使用。

此外,还可以在浏览器中使用生成式AI(如Qwen模型)总结结果,或者连接Ollama的重型Llama2实例。

高级用例

  • 使用多语言嵌入翻译单词,或查看给定列表中哪些单词与您的输入单词最相似。使用约30k英语单词的索引,您可以使用超过100种输入语言进行查询!请注意,这里的专家设置更改,以便仅显示第一个匹配项。
  • 英语同义词查找器,再次使用约30k英语单词的索引,但使用稍好(且更小)的英语专用嵌入。这里的专家设置相同。
  • 通用索引概念,即使用30k英语单词索引,不对任何新单词进行推理。这样,您可以在未知/未见/未索引的文本上执行即时语义搜索!使用此URL,然后复制并粘贴您选择的任何文本到文本字段中。关闭新单词的推理以提高速度。
  • 通用索引的混合版本,您使用30k英语单词作为起始索引,然后“填充”索引尚不知道的所有额外单词。对于此选项,只需使用此URL,其中推理再次开启。这产生最佳结果,并且可能是很好的折衷方案,假设新文本通常没有那么多新单词。即使有几百个(如特定领域的研究论文),推理也相当快。
搜集汇总
数据集介绍
构建方式
在自然语言处理与语义搜索领域,数据集的质量与构建方式直接决定了检索系统的性能与用户体验。SemanticFinder数据集由do-me团队精心构建,旨在为前端纯浏览器环境下的实时语义搜索提供标准化索引资源。该数据集包含多个公共领域或具有公共兴趣的文档,如《圣经》、《堂吉诃德》、《资本论》及联合国人权宣言等,覆盖英语、西班牙语、德语、法语、希腊语、意大利语等多种语言。每份文档经过文本分割与嵌入向量化处理,原始文本被切分为字符或单词级别的片段,并采用如TaylorAI/gte-tiny、Xenova/multilingual-e5-base等轻量级Transformer模型生成稠密向量表示。所有向量经过量化以减小文件体积,并附带详尽元数据,包括文本标题、作者、年份、语言、分割参数及来源URL,最终以JSON.GZ压缩格式存储,便于在SemanticFinder应用中直接导入与检索。
使用方法
使用SemanticFinder数据集进行语义搜索极为便捷,用户只需访问SemanticFinder应用,点击数据集中提供的示例URL即可自动加载对应的索引文件。加载完成后,在搜索框中输入任意查询词句,系统将基于嵌入向量的余弦相似度在客户端本地完成检索,结果几乎即时呈现。对于高级用户,数据集支持多种定制化搜索模式,例如通过启用'firstOnly'参数仅显示最佳匹配项,或关闭推理功能以实现对未见文本的零样本语义搜索。用户还可利用多语言嵌入模型实现跨语言查询,例如以100多种语言输入来检索英语单词列表。此外,所有索引文件均可从HuggingFace仓库直接下载,并支持在本地网络环境中部署,保障敏感文档的隐私安全。开发者亦可参照README中的指南,通过Python脚本生成元数据表格,将自定义索引贡献至官方数据集集合。
背景与挑战
背景概述
SemanticFinder数据集由开发者do-me于2024年创建,旨在推动前端语义搜索技术的民主化。该数据集基于Transformers.js框架,整合了从经典文学(如《国王詹姆斯圣经》《堂吉诃德》)到现代文献(如2023年IPCC报告)的多语言、多类型文本资源,并预先计算了文本块及其嵌入向量。其核心研究问题在于探索如何在不依赖后端服务器的情况下,仅通过浏览器实现实时的语义级文本检索,从而突破传统关键词匹配的局限。该数据集通过提供可直接导入的索引文件,显著降低了语义搜索技术的使用门槛,对自然语言处理、信息检索及前端开发领域产生了重要影响,尤其推动了轻量化、去中心化搜索方案的实践。
当前挑战
SemanticFinder面临的核心挑战在于平衡搜索精度与计算效率。领域层面,语义搜索需解决多语言文本的跨语言理解歧义性与长文档的上下文连贯性难题,例如在《神曲》的意大利语原文与《资本论》的德语文本中保持嵌入向量的语义保真度。构建过程中,挑战集中于大规模文本的分块策略优化——不同语言与文体需适配差异化的分块参数(如字符数或词数),以避免信息碎片化或语义断裂。此外,量化模型(如gte-tiny)在减少文件体积时可能导致精度损失,而多模型(如multilingual-e5-base与bge-small-en)的兼容性测试亦增加了数据准备的复杂度。隐私保护方面,如何在公开索引中规避敏感内容泄露,同时维持本地化使用的灵活性,成为技术架构设计的另一关键瓶颈。
常用场景
经典使用场景
SemanticFinder 数据集的核心应用场景在于为大规模文本集合提供前端实时语义搜索能力,其经典使用方式是将任意长文本(如《圣经》、《堂吉诃德》或法律文献)切分为语义单元并生成嵌入向量,用户通过浏览器即可对整部著作进行近似于自然语言理解的模糊匹配检索,而无需依赖后端服务器。该数据集预置了多种语言和领域的索引文件,覆盖从古典文学到现代科学报告的广泛文本类型,使得研究者能够即刻体验超越传统关键词匹配的语义级信息获取。
解决学术问题
在学术研究领域,SemanticFinder 有效解决了传统信息检索中因词汇表不匹配而导致的语义鸿沟问题,尤其适用于跨语言文献分析、古籍数字化研究以及大规模语料库的快速探索。该数据集通过提供标准化的嵌入索引,使得学者能够基于语义相似度而非字面匹配来挖掘文本间的潜在关联,从而推动了数字人文学科中文本挖掘方法论的发展,并显著降低了在低资源环境下构建语义搜索系统的技术门槛。
实际应用
实际应用中,SemanticFinder 数据集被广泛部署于需要隐私保护或离线运行的场景,例如敏感文档的内部检索、教育机构中的经典文献教学辅助以及法律条文的快速对照查询。其创新的“通用索引”机制允许用户仅凭一个预构建的英文单词嵌入库,即可对任意未索引的新文本进行近乎即时的语义搜索,这一特性在实时翻译辅助、跨语言术语对齐以及知识图谱的动态扩展中展现出极高的实用价值。
数据集最近研究
最新研究方向
SemanticFinder数据集专注于推动轻量化、客户端语义搜索技术的发展,其前沿研究方向聚焦于利用transformers.js在浏览器中实现无需后端服务器的实时语义检索。该数据集集成了多语种嵌入模型(如gte-tiny、multilingual-e5)与量化技术,覆盖从古典文献到现代法规的多元文本,并探索了通用索引与即时搜索的创新范式。近期热点包括跨语言翻译、同义词发现及emoji语义匹配等高级应用,显著降低了语义搜索的部署门槛。其影响在于加速了自然语言处理技术在隐私保护、离线场景下的民主化进程,为前端AI应用开辟了新路径。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务