greek-synth-v1
收藏资源简介:
Greek Synthetic Data 是一个希腊语合成预训练数据集,专为文本生成任务设计。该数据集通过四种教学丰富的提示格式(FAQ、数学、表格、教程)对源文档进行重述生成,旨在提供高质量的预训练数据。数据基于源语料库 alexliap/high-quality-gr-text 生成,覆盖了 wikipedia_el 和 finewiki_el 配置,而 finepdfs_el 和 fineweb_hq_el 配置尚未完成。数据集包含四个配置(faq、math、table、tutorial),每个配置对应一种提示格式,数据以 Parquet 分片形式存储。每个数据样本包含以下字段:text(合成输出文本)、source_id(源文档ID)、source_data(源数据集配置)、prompt(提示格式,如 faq、math、table、tutorial)、model(重述模型及版本)和 language_confidence(基于 fastText lid.176 的希腊语概率后过滤置信度)。生成过程使用 Qwen/Qwen3.5-2B 模型通过 vLLM 端点在 Lightning AI 基础设施上运行,代码开源在 gr-synth 仓库。该数据集适用于希腊语文本生成、预训练和合成数据研究等场景。
数据集概述
- 名称: Greek Synthetic Data (
greek-synth-v1) - 许可证: Apache-2.0
- 语言: 希腊语 (el)
- 任务类别: 文本生成 (text-generation)
- 标签: 合成 (synthetic), 希腊语 (greek), 预训练 (pretraining)
数据集描述
该数据集是通过将原始文档重新表述为四种教学丰富的提示格式(FAQ、Math、Table、Tutorial)生成的希腊语合成预训练数据。生成方法基于《The Synthetic Data Playbook: Generating Trillions of the Finest Tokens》。
覆盖状态
数据集基于源语料库 alexliap/high-quality-gr-text,每个配置分别进行重新表述,并合并到相同的提示子目录中。源配置信息保留在每一行的 source_data 列中。覆盖状态如下:
- ✅
wikipedia_el(已完成) - ✅
finewiki_el(已完成) - ❌
finepdfs_el(未完成) - ❌
fineweb_hq_el(未完成)
数据配置与文件
数据集包含四个配置,每个配置对应一种提示格式,数据以 Parquet 格式分片存储:
| 配置 (config_name) | 数据文件路径 |
|---|---|
| faq | faq/*.parquet |
| math | math/*.parquet |
| table | table/*.parquet |
| tutorial | tutorial/*.parquet |
数据模式 (Schema)
每一行数据包含以下字段:
| 列名 | 类型 | 说明 |
|---|---|---|
text |
string | 合成生成的文本输出 |
source_id |
string | 原始文档的 ID |
source_data |
string | 原始文档所在的源数据集配置 |
prompt |
string | 提示格式:faq, math, table, tutorial 之一 |
model |
string | 用于重新表述的模型及其修订版本 |
language_confidence |
float32 | 基于 fastText lid.176 模型的希腊语概率后过滤得分 |
基础设施与生成
- 生成平台: 使用 Lightning AI 运行。
- 重新表述模型:
Qwen/Qwen3.5-2B,通过托管在 Lightning Studio 上的 vLLM 端点提供服务。 - 流水线: 从独立机器将源语料库流式输入模型。
- 生成代码: 代码仓库为
alexliap/gr_synth(GitHub)。




