Ancient Greek human-vs-LLM stylometry corpus
收藏资源简介:
该数据集是一个古希腊人类与大型语言模型(LLM)风格计量学语料库,用于比较最先进的LLM(如GPT-5.5、Claude 4.8)与人类阿提卡演说家在古希腊语写作上的相似性。数据源包括119篇人类阿提卡演说家文本(10位作者),分析单元为句子/词对齐的块(chunk),设计条件包括两种提示(限制性重写和自由重写)和多种模型版本,并包含特征提取和嵌入分析。数据集以CC BY-SA 4.0许可证发布,适用于语言资源和评估研究。
This dataset is an Ancient Greek stylometric corpus for comparing the writing stylistic similarity between state-of-the-art large language models (LLMs, e.g., GPT-5.5, Claude 4.8) and human Attic orators. Its data sources include 119 texts from human Attic orators across 10 authors. The analysis units are sentence- and word-aligned chunks. The experimental design covers two prompt types (restrictive rewriting and free rewriting) and multiple model versions, as well as feature extraction and embedding analysis. This dataset is released under the CC BY-SA 4.0 license, and is applicable to language resource and evaluation research.
数据集概述
该数据集是一个面向古希腊语的文体风格分析与评估资源,专门用于比较顶尖大语言模型(GPT-5.5、Claude 4.8、GPT-4o、Claude 3.5)生成的古希腊语文本与人类阿提卡演说家(共10位作者、119篇原文)在文体和语言学特征上的相似性。
核心用途
- 评估当代LLM生成古希腊语文本的文体逼真度。
- 比较不同代模型(旧版 GPT-4o / Claude 3.5 vs. 新版 GPT-5.5 / Claude 4.8)在模仿古希腊语方面的进步。
- 提供一个可复现的块级(chunk-level)文体测量与语言学评估流水线。
数据集构成
- 来源:119篇人类阿提卡演说家文本(10位作者)。
- 分析单元:块(句子/词对齐),长度通过校准实验确定,确保模型能忠实复现原文长度。
- 条件:2种提示(Restricted —— 尽量贴近原文包括长度;Free —— 保留语义但灵活表达) × 4个模型(GPT-5.5、Claude 4.8、GPT-4o、Claude 3.5)。
- 类别体系:Category1=系统,Category2=作者,Category3=提示类型,Category4=标签,扩展含
doc_id、chunk_id、chunk_index、model_version、text_file。
数据文件组织
data/:块、生成的重写文本、特征、嵌入向量。configs/:中心配置(路径、模型ID、设计、分块参数)。prompts/:版本化的受限(Restricted)和自由(Free)提示。output/:日志、表格、图表及分析输出。env/:固定依赖需求与环境说明。
可复现性
提供完整的Python 3.12流水线,按序执行:
- 探测可用模型ID;
- 校准块大小;
- 构建语料库块清单;
- 生成模型重写文本;
- 提取块级特征与嵌入向量;
- 运行预设分析(含SOTA统计与纵向比较)。
- 需设置
OPENAI_API_KEY和ANTHROPIC_API_KEY。 - 嵌入距离矩阵文件(
.npy,约333 MB)因GitHub限制未包含,可通过重新运行嵌入分析生成。
许可与引用
- 代码许可:MIT。
- 数据/语料许可:CC BY-SA 4.0(人类文本源于Perseus数字图书馆版本,继承相同许可,再分发需署名并遵循相同条款)。
- 引用:请引用其Zenodo存档(DOI: 10.5281/zenodo.20584471),机器可读元数据见
CITATION.cff。
注意事项
- 分析引擎复用自作者前期工作,需适配当前项目的列模式。
- 默认
torch为CPU版本,可安装CUDA版以加速嵌入/困惑度计算。 - Claude 3.5已不被当前API支持,故其数据使用旧有文档(未重新分块)作为纵向比较基准。




