dataset-nli-tagalog-health
收藏资源简介:
该数据集包含从Tagalog文章中提取的与健康相关的信息,如疾病、治疗方法或公共卫生指南。提取的内容被格式化为JSON格式,包含URL和相关前提。
This dataset contains health-related information extracted from Tagalog articles, including diseases, treatment methods or public health guidelines. The extracted content is formatted as JSON, which includes URLs and relevant premises.
数据集概述
数据集获取方法
- 找到一篇关于疾病的塔加洛语文章。
- 将文章粘贴到GPT中(替换文章和URL)。
数据集使用方法
提取前提
-
确保提取的句子直接与健康相关,并尽可能保留原始意义。
-
输出格式为JSON: json { "url": "[插入URL]", "premises": [ {"premise": "[第一条健康相关前提]"}, {"premise": "[第二条健康相关前提]"}, ... ] }
-
确保每个前提与健康主题相关,避免改变原始语言,除非绝对必要。
使用premise.py
-
将输入JSON更改为仅包含前提的有效格式: json { "url": "URL_HERE", "premises": [ {"premise": "PREMISE_1"}, {"premise": "PREMISE_2"}, {"premise": "PREMISE_3"} ] }
-
运行: bash python premise.py
使用hypothesis.py
-
确保已运行premise.py并获得一组前提。
-
运行: bash python hypothesis.py
-
检查随机选择的前提并输入假设/声明(确保非AI生成,以避免过拟合)。
-
按Enter键。
-
取消操作请按Ctrl + c。
合并前提文件
- 滚动到页面底部。
- 替换file1和file2变量(通常是您创建的文件和其他组的文件)。
- 运行: bash python combine-premise.py
合并假设文件
- 滚动到页面底部。
- 替换file1和file2变量(通常是您创建的文件和其他组的文件)。
- 运行: bash python combine-hypothesis.py




