FreedomIntelligence/Socratic
收藏相关数据集
FreedomIntelligence/huatuo26M-testdatasets
我们很高兴发布我们的评估数据集,这是Huatuo-26M的一个子集。该数据集包含6000个条目,用于我们相关研究论文中的自然语言生成(NLG)实验。我们鼓励研究人员和开发者使用此评估数据集来衡量他们自己模型的性能。这不仅是评估生成响应的准确性和相关性的机会,也是研究模型在理解和生成复杂医学语言方面能力的机会。注意:所有数据点都已匿名化,以保护患者隐私,并严格遵守数据保护和隐私法规。
Hugging Face2023-05-17 更新1020
FreedomIntelligence/HuatuoGPT2-SFT-GPT4-140K
HuatuoGPT2-SFT-GPT4-140K数据集包含14万条由GPT-4生成的中文医疗指令,这些指令基于HuatuoGPT数据集的问题。该数据集用于HuatuoGPT2的监督微调,旨在增强模型在真实医疗场景中遵循指令的能力。数据集中的所有数据(142,248条)均已公开。
Hugging Face2024-06-25 更新850
FreedomIntelligence/TCM-Pretrain-Data-ShizhenGPT
这是一个用于ShizhenGPT模型预训练的中医学数据集,包含了从中医相关网站和书籍中收集的文本数据,以及图像和文本结合的预训练数据。它是目前最大的中医语料库数据集,包含了超过50亿个token。数据集分为五部分:中医书籍语料库(TCM_Book_Corpus)、中医网页语料库(TCM_Web_Corpus)、中医书籍图文混合数据(TCM_Book_Interleaved_Data)、中医网页图文
Hugging Face2025-09-08 更新480
FreedomIntelligence/ALLaVA-4V-Chinese
--- license: apache-2.0 task_categories: - question-answering - text-generation language: - zh tags: - GPT-4V - LVLM - Vision - Language size_categories: - 1M<n<10M configs: - config_name: allava_l
Hugging Face2024-04-29 更新1000
FreedomIntelligence/ALLaVA-4V
ALLaVA-4V数据集是一个包含图像描述和复杂推理问答对的多模态数据集,主要使用GPT-4V和GPT-4-Turbo模型生成数据。数据集分为多个子集,包括ALLaVA-Caption-LAION-4V、ALLaVA-Caption-VFLAN-4V、ALLaVA-Instruct-LAION-4V、ALLaVA-Instruct-VFLAN-4V和Evol-Instruct-GPT4-Turbo
Hugging Face2025-06-08 更新690



