Treebank-3
收藏资源简介:
<h3>Introduction</h3><br> <p>This release contains the following <a href="http://catalog.ldc.upenn.edu/LDC95T7" rel="nofollow">Treebank-2</a> Material:</p><br> <ul><br> <li>One million words of 1989 Wall Street Journal material annotated in Treebank II style.</li><br> <li>A small sample of ATIS-3 material annotated in Treebank II style.</li><br> <li>A fully tagged version of the Brown Corpus.</li><br> </ul><br> <p>and the following new material:</p><br> <ul><br> <li>Switchboard tagged, dysfluency-annotated, and parsed text</li><br> <li>Brown parsed text</li><br> </ul><br> <p>The Treebank bracketing style is designed to allow the extraction of simple predicate/argument structure. Over one million words of text are provided with this bracketing applied.</p><br> <h3>Data</h3><br> <p>The Penn Treebank (PTB) project selected 2,499 stories from a three year Wall Street Journal (WSJ) collection of 98,732 stories for syntactic annotation. These 2,499 stories have been distributed in both Treebank-2 (<a href="../../../LDC95T7">LDC95T7</a>) and Treebank-3 (<a href="../../../LDC99T42">LDC99T42</a>) releases of PTB. Treebank-2 includes the raw text for each story. Three "map" files are available in a compressed file (pennTB_tipster_wsj_map.tar.gz) as an additional download for users who have licensed Treebank-2 and provide the relation between the 2,499 PTB filenames and the corresponding WSJ DOCNO strings in TIPSTER.</p><br> <h3>Samples</h3><br> <p>Please view the following samples:</p><br> <ul><br> <li><a href="desc/addenda/LDC99T42.pos.txt">Part-of-Speech Tags</a></li><br> <li><a href="desc/addenda/LDC99T42.dff.txt">Dysfluency Annotation</a></li><br> <li><a href="desc/addenda/LDC99T42.mgd.txt">Dysfluency Annotation & Part-of-Speech Tags</a></li><br> <li><a href="desc/addenda/LDC99T42.dps.txt">Dysfluency Annotation, Part-of-Speech Tags & Turns Joined</a></li><br> <li><a href="desc/addenda/LDC99T42.prd.txt">Syntactic Annotation</a></li><br> <li><a href="desc/addenda/LDC99T42.mrg.txt">Syntactic Annotation & Part-of-Speech Tags</a></li><br> </ul><br> <h3>Updates</h3><br> <p>After publication, it was discovered that not all of the postscript (*.ps) files had been converted to pdfs and that some of the converted pdfs contained errors. For pdf copies of the documentation files, please go to <a href="desc/addenda/LDC1999T42" rel="nofollow">addenda</a> for a list of the files available.</p><br> <p>As of October 5, 2016 252 wsj files from <a href="http://catalog.ldc.upenn.edu/LDC95T7" rel="nofollow">Treebank-2</a> were added that were previously missing.</p><br> <p>As of February, 2017, 2,499 "raw" wsj files were added from Treebank-2 (<a href="../../../LDC95T7">LDC95T7</a>).</p><br> <p>Corpus downoads after these dates will include these missing files.</p></br> Portions © 1987-1989 Dow Jones & Company, Inc., © 1993-1995, 1999 Trustees of the University of Pennsylvania
<h3>引言</h3><br> <p>本发布包包含以下<a href="http://catalog.ldc.upenn.edu/LDC95T7" rel="nofollow">句法树库2(Treebank-2)</a>素材:</p><br> <ul><br> <li>100万词量的1989年《华尔街日报》语料,采用句法树库II式标注。</li><br> <li>少量采用句法树库II式标注的ATIS-3语料样本。</li><br> <li>完整带标注的布朗语料库(Brown Corpus)版本。</li><br> </ul><br> <p>同时包含以下新增素材:</p><br> <ul><br> <li>带标注、含不流利现象标记且已完成句法分析的Switchboard语料</li><br> <li>带句法分析的布朗语料库文本</li><br> </ul><br> <p>句法树库的括号标注格式旨在支持简单谓词-论元结构的提取。本发布包提供超100万词量的该格式标注文本。</p><br> <h3>数据集</h3><br> <p>宾夕法尼亚句法树库(Penn Treebank, PTB)项目从三年期、含98732篇报道的《华尔街日报》(Wall Street Journal, WSJ)馆藏中遴选2499篇报道用于句法标注。这2499篇报道已随宾夕法尼亚句法树库的Treebank-2(<a href="../../../LDC95T7">LDC95T7</a>)与Treebank-3(<a href="../../../LDC99T42">LDC99T42</a>)两个版本发布。Treebank-2包含每篇报道的原始文本。针对已授权获取Treebank-2的用户,额外提供一个压缩文件`pennTB_tipster_wsj_map.tar.gz`,其中包含3个“映射文件”,用于关联2499篇PTB语料文件名与TIPSTER格式中对应的WSJ DOCNO字符串。</p><br> <h3>样本</h3><br> <p>请查看以下样本:</p><br> <ul><br> <li><a href="desc/addenda/LDC99T42.pos.txt">词性标注(Part-of-Speech Tags)</a></li><br> <li><a href="desc/addenda/LDC99T42.dff.txt">不流利现象标注(Dysfluency Annotation)</a></li><br> <li><a href="desc/addenda/LDC99T42.mgd.txt">不流利现象标注与词性标注</a></li><br> <li><a href="desc/addenda/LDC99T42.dps.txt">不流利现象标注、词性标注与会话轮次合并</a></li><br> <li><a href="desc/addenda/LDC99T42.prd.txt">句法标注(Syntactic Annotation)</a></li><br> <li><a href="desc/addenda/LDC99T42.mrg.txt">句法标注与词性标注</a></li><br> </ul><br> <h3>更新说明</h3><br> <p>发布后发现,部分PostScript(*.ps)文件未转换为PDF格式,且部分已转换的PDF文件存在错误。如需获取文档文件的PDF版本,请访问<a href="desc/addenda/LDC1999T42" rel="nofollow">附加资源页面</a>查看可用文件列表。</p><br> <p>截至2016年10月5日,补充新增了此前缺失的252篇来自<a href="http://catalog.ldc.upenn.edu/LDC95T7" rel="nofollow">Treebank-2</a> 的WSJ语料文件。</p><br> <p>截至2017年2月,补充新增了来自Treebank-2(<a href="../../../LDC95T7">LDC95T7</a>)的2499篇WSJ原始语料文件。</p><br> <p>上述日期之后的语料下载包将包含此前缺失的全部文件。</p><br> <p>本数据集部分内容 © 1987-1989 道琼斯公司版权所有,© 1993-1995、1999 宾夕法尼亚大学校董会版权所有</p>

- Treebank-3首次发表,标志着大规模树库构建的开始。
- Treebank-3首次应用于自然语言处理研究,特别是在句法分析和机器翻译领域。
- Treebank-3的扩展版本发布,增加了更多的语料和语言覆盖,提升了其在多语言研究中的应用价值。
- Treebank-3成为自然语言处理领域的重要基准数据集,广泛用于句法解析算法的评估和比较。
- Treebank-3的数据被用于深度学习模型的训练,推动了神经网络在自然语言处理中的应用。
- Treebank-3的最新修订版发布,进一步优化了数据质量和覆盖范围,适应了现代自然语言处理技术的需求。



