maknee/bioasq_bier_1024_100k
收藏资源简介:
--- license: mit task_categories: - feature-extraction - text-retrieval language: - en configs: - config_name: default data_files: - split: train path: "parquet/base.parquet" --- # BioASQ-BEIR Vector Database Dataset (1024d, 100k) Generated embeddings dataset for vector database training and evaluation. ## Dataset Summary This dataset contains 100,000 text samples with vector embeddings (1024 dimensions) generated from the BioASQ-BEIR dataset using Qwen/Qwen3-Embedding-8B. ## Dataset Structure - **Base dataset**: 100,000 samples with embeddings - **Embedding dimension**: 1024 ## Repository Structure ### parquet/ - `base.parquet` - Main dataset with text and embeddings ## Usage ### Loading with HuggingFace Datasets ```python from datasets import load_dataset dataset = load_dataset("maknee/bioasq_bier_1024_100k") base_data = dataset['train'] import numpy as np embeddings = np.array(base_data['embedding']) texts = base_data['text'] ``` ## Dataset Information - **Source**: BioASQ-BEIR - **Size**: 100,000 samples - **Dimension**: 1024 - **Format**: Parquet ## Citation ```bibtex @dataset{huggingface_embeddings_maknee_bioasq_bier_1024_100k, title={BioASQ-BEIR Vector Database Embeddings Dataset}, author={Henry Zhu}, year={2026}, url={https://huggingface.co/datasets/maknee/bioasq_bier_1024_100k} } ``` ## License MIT License.



