遇见数据集

gaianet/vitalik.eth

收藏
Hugging Face2024-03-23 更新2024-06-11 收录
官方服务:

资源简介:

--- license: apache-2.0 --- Prepare Qdrant: ``` mkdir qdrant_storage mkdir qdrant_snapshots ``` Start Qdrant: ``` docker run -d -p 6333:6333 -p 6334:6334 \ -v $(pwd)/qdrant_storage:/qdrant/storage:z \ -v $(pwd)/qdrant_snapshots:/qdrant/snapshots:z \ qdrant/qdrant ``` Create collection: ``` curl -X PUT 'http://localhost:6333/collections/vitalik.eth' \ -H 'Content-Type: application/json' \ --data-raw '{ "vectors": { "size": 384, "distance": "Cosine", "on_disk": true } }' ``` Query collection: ``` curl 'http://localhost:6333/collections/vitalik.eth' ``` Optional: delete collection ``` curl -X DELETE 'http://localhost:6333/collections/vitalik.eth' ``` Get embedding model: ``` curl -LO https://huggingface.co/second-state/All-MiniLM-L6-v2-Embedding-GGUF/resolve/main/all-MiniLM-L6-v2-ggml-model-f16.gguf ``` Get the embedding app: ``` curl -LO https://raw.githubusercontent.com/YuanTony/chemistry-assistant/main/rag-embeddings/create_embeddings.wasm ``` Create and save the generated embeddings: ``` wasmedge --dir .:. --nn-preload default:GGML:AUTO:all-MiniLM-L6-v2-ggml-model-f16.gguf create_embeddings.wasm default vitalik.eth 384 vitalik-eth.txt ``` Check the results: ``` curl 'http://localhost:6333/collections/vitalik.eth' ``` Create snapshot: ``` curl -X POST 'http://localhost:6333/collections/vitalik.eth/snapshots' ``` Access the snapshots: ``` ls qdrant_snapshots/vitalik.eth/ ```

许可证:Apache-2.0 准备Qdrant: mkdir qdrant_storage mkdir qdrant_snapshots 启动Qdrant: docker run -d -p 6333:6333 -p 6334:6334 -v $(pwd)/qdrant_storage:/qdrant/storage:z -v $(pwd)/qdrant_snapshots:/qdrant/snapshots:z qdrant/qdrant 创建集合: curl -X PUT 'http://localhost:6333/collections/vitalik.eth' -H 'Content-Type: application/json' --data-raw '{ "vectors": { "size": 384, "distance": "Cosine", "on_disk": true } }' 查询集合: curl 'http://localhost:6333/collections/vitalik.eth' (可选)删除集合: curl -X DELETE 'http://localhost:6333/collections/vitalik.eth' 获取嵌入模型: curl -LO https://huggingface.co/second-state/All-MiniLM-L6-v2-Embedding-GGUF/resolve/main/all-MiniLM-L6-v2-ggml-model-f16.gguf 获取嵌入应用程序: curl -LO https://raw.githubusercontent.com/YuanTony/chemistry-assistant/main/rag-embeddings/create_embeddings.wasm 生成并保存嵌入向量: wasmedge --dir .:. --nn-preload default:GGML:AUTO:all-MiniLM-L6-v2-ggml-model-f16.gguf create_embeddings.wasm default vitalik.eth 384 vitalik-eth.txt 检查结果: curl 'http://localhost:6333/collections/vitalik.eth' 创建快照: curl -X POST 'http://localhost:6333/collections/vitalik.eth/snapshots' 访问快照: ls qdrant_snapshots/vitalik.eth/

提供机构:
gaianet
原始信息汇总

数据集概述

数据集许可证

  • 许可证: Apache-2.0

数据集操作流程

  1. 环境准备

    • 创建存储目录:mkdir qdrant_storagemkdir qdrant_snapshots
  2. 启动服务

    • 使用Docker启动Qdrant服务,映射端口和存储目录。
  3. 创建集合

    • 使用HTTP请求创建名为vitalik.eth的集合,设置向量大小为384,距离计算方式为余弦距离,存储方式为磁盘存储。
  4. 查询集合

    • 通过HTTP请求查询vitalik.eth集合。
  5. 删除集合(可选)

    • 通过HTTP请求删除vitalik.eth集合。
  6. 获取嵌入模型

    • 下载嵌入模型文件all-MiniLM-L6-v2-ggml-model-f16.gguf
  7. 获取嵌入应用

    • 下载嵌入应用create_embeddings.wasm
  8. 生成并保存嵌入

    • 使用WasmEdge运行嵌入应用,生成并保存嵌入到vitalik-eth.txt
  9. 检查结果

    • 再次查询vitalik.eth集合以检查结果。
  10. 创建快照

    • vitalik.eth集合创建快照。
  11. 访问快照

    • 列出qdrant_snapshots/vitalik.eth/目录下的快照文件。
搜集汇总
数据集介绍
gaianet/vitalik.eth 数据集图片
构建方式
在去中心化技术与数字身份日益融合的当下,该数据集围绕以太坊联合创始人Vitalik Buterin的链上活动构建。其构建过程首先通过Qdrant向量数据库创建专用集合,设定向量维度为384、采用余弦距离度量并启用磁盘存储。随后利用All-MiniLM-L6-v2嵌入模型,借助WasmEdge运行时将文本数据转化为高维向量表示,最终将生成的嵌入向量持久化至Qdrant存储中,形成结构化的语义索引。
特点
该数据集的核心特色在于其面向链上身份的知识表征能力。通过将Vitalik Buterin的公开文本数据映射至384维的语义空间,实现了对分散化信息的高效检索与相似度匹配。数据以向量快照形式存储,支持完整的集合管理操作,包括创建、查询与删除,兼顾了数据持久性与灵活性。其基于余弦距离的度量方式,确保了语义相关性的准确捕捉。
使用方法
使用者需先通过Docker部署Qdrant服务并创建vitalik.eth集合。随后获取嵌入模型与WasmEdge应用,通过运行create_embeddings.wasm工具将文本文件转化为向量并存入数据库。查询时可直接调用Qdrant的HTTP API进行向量检索,亦可利用快照功能实现数据备份与迁移,整体流程简洁且高度自动化。
背景与挑战
背景概述
该数据集由GaiaNet团队创建,聚焦于以太坊联合创始人Vitalik Buterin(vitalik.eth)的公开文本数据,旨在为去中心化知识检索与语义理解提供高质量向量化资源。研究背景植根于区块链与人工智能交叉领域,核心问题在于如何通过嵌入模型将非结构化文本转化为可高效查询的向量表示,以支持智能合约、DAO治理等场景下的语义搜索。数据集采用384维向量空间与余弦相似度度量,结合轻量级All-MiniLM-L6-v2嵌入模型,通过Qdrant向量数据库实现持久化存储与快速检索。自发布以来,该数据集为去中心化应用开发者提供了标准化语义索引范例,推动了链上数据与AI推理的融合实践。
当前挑战
当前挑战主要体现在两方面:一是领域问题层面,区块链文本数据常包含高度专业术语(如EIP提案、智能合约代码)及多语言混杂内容,现有通用嵌入模型难以精准捕获其语义特征,导致检索准确率受限;二是构建过程中,需解决从原始文本到向量存储的端到端流程可靠性问题,包括确保嵌入模型在GGUF格式下的兼容性、处理大规模文本的分批向量化效率,以及通过Qdrant快照机制保障数据持久化与灾备恢复。此外,向量维度的选择(384维)与距离度量(余弦相似度)需在精度与存储开销间取得平衡,这对资源受限的去中心化节点尤为关键。
常用场景
经典使用场景
在知识图谱与语义检索的交叉领域中,gaianet/vitalik.eth数据集以其独特的以太坊生态文本语料为核心,为构建面向区块链技术的高质量向量数据库提供了绝佳素材。该数据集经嵌入模型转化为384维稠密向量后,可支撑基于余弦相似度的语义搜索任务,尤其适合用于检索与Vitalik Buterin相关的技术观点、以太坊改进提案或去中心化治理论述。研究者可将其作为基准,测试不同嵌入模型在加密货币领域语义理解上的表现,或对比稀疏检索与稠密检索在技术文档中的精度差异。
实际应用
在实际应用中,该数据集可赋能去中心化自治组织(DAO)的智能知识管理系统,通过语义检索快速定位关键提案的技术细节与历史讨论。开发者可将其集成至区块链浏览器或开发者工具中,实现基于自然语言的技术文档问答功能。例如,用户输入'以太坊分片的最新进展'时,系统能从向量数据库中召回Vitalik相关推文或演讲的精确定位段落,显著提升信息获取效率。该数据集还适用于构建个性化加密资产分析助手,辅助投资者理解技术路线图背后的逻辑脉络。
衍生相关工作
该数据集衍生出一系列开创性工作,包括基于RAG(检索增强生成)架构的加密领域对话系统,其中研究者利用该向量数据库作为外部知识源,结合大语言模型生成上下文感知的技术解答。另有工作将其与以太坊交易图谱联合,构建多模态知识库,用于推理地址间的语义关联。部分学者还基于该数据集验证了跨语言嵌入对齐方法,证明英文技术术语与中文社区表述的语义映射可行性,为多语言加密知识导航奠定了基础。这些工作共同拓展了向量数据库在Web3生态中的研究边界。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务