相关数据集
humanizer-artifacts
该数据集是“humanizer”研究项目的一部分,旨在通过分布微调(DFT)工作流训练模型,使AI生成的文本在风格和分布上更接近人类写作。数据集由文本对组成,每个对包含“人类原始文本”和由AI模型(如Qwen或Codex风格模型)生成的“朴素改写”文本,训练方向是“AI改写 -> 人类原始”,即学习将AI改写文本还原为更自然的人类写作风格,同时严格保留原文的事实、数字、引用、格式(如LaTeX、代
Hugging Face2026-05-30 更新220
style-aware-paraphraser-author-bank-reddit
本数据集名为“Style-Aware Paraphraser — Reddit Author Targets Bank”,是一个用于风格感知文本复述任务的目标风格参考库。它包含了12,000个匿名Reddit作者,每个作者对应一个数据条目。每个条目提供两个核心部分:1) `reference_text`:包含来自同一作者的16条历史评论,作为该作者写作风格的示例;2) `paraphrase_re
Hugging Face2026-06-15 更新100
ACL Anthology Corpus; LLM-Assisted Paraphrases
本研究构建了两个核心数据集,旨在探究大语言模型对科学写作风格的影响。ACL Anthology Corpus是一个自然语料库,包含从ACL Anthology中收集的37,760篇NLP领域论文(2020-2024年),总计约2.038亿Tokens,数据通过GROBID从PDF中提取并经过预处理。LLM-Assisted Paraphrases是一个合成数据集,包含3,000对人工撰写的文本段落
arXiv2026-05-19 更新130
mjbommar/opengloss-v1.2-encyclopedia-variants
--- license: cc-by-4.0 task_categories: - text-generation - summarization language: - en tags: - style-transfer - paraphrase - text-simplification - encyclopedia - lexicon - synthetic - education - op
Hugging Face2026-04-08 更新90



