SUCX 3.0
收藏资源简介:
Stockholm-Umeå-korpus (SUC) är en samling svenska texter från 1990-talet, med totalt en miljon ord. Korpusen är balanserad, vilket betyder att den innehåller olika texttyper och texter med olika stilnivåer. Texterna har märkts upp med ordklasstaggar, morfologisk analys och lemma (allt detta kan anses som referensdata), samt viss strukturell och funktionell information. Version 1.0 utvecklades i samarbete mellan Gunnel Källgren vid Stockholms Universitet och Eva Ejerhed vid Umeå universitet och gjordes tillgängligt 1997 av institutionen för lingvistik på Stockholms universitet. Version 2.0 gjordes tillgänglig 2006 av Sofia Gustafsson Capkova och Britt Hartmann vid institutionen för lingvistik på Stockholms universitet. Den innehåller samma texter som SUC 1.0 men är utökad med viss annotering. Dessutom innehåller SUC 2.0 två bonusmaterial. TigerSUC är SUC 2.0 konverterad till TIGER-XML av Martin Volk. StorSUC är ytterligare SUC-material om fyra miljoner ord. Version 3.0 finns tillgänglig sedan 2012. Den innehåller förbättrad annotering, samt oannoterade texter om sju miljoner ord. (För TigerXML-versionen, Suc2c, Suc2d och DTD:erna hänvisar vi fortfarande till version 2.0.) Ytterligare information om sammanställning och uppmärkning av SUC finns i manualen för SUC 2.0 [PDF] Språkbanken distribuerar SUC 2.0 och SUC 3.0 i två varianter: SUC 2.0 och SUC 3.0: fritt tillgänglig för forskning; kräver individuell licens SUCX 2.0 och SUCX 3.0: meningar i omkastad ordning; berikad med automatisk annotering; nedladdningsbar utan restriktioner SUCX 3.0 SUCX går att ladda ner direkt under den öppna CC BY-SA-licensen här nedanför. Denna variant är meningsomkastad, och dessutom har extra uppmärkning lagts till automatiskt av Språkbankens textanalysverktyg. Korpusen distribueras i Språkbankens standard-XML-format. Följande annoteringar är som i den officiella versionen: ordklass (pos-attribut på ordelement) morfologiska särdrag (msd-attribut) grundform (lemma-attribut) namngivna entiteter (endast SUC 3.0; <name>-taggar, inte <ne>-taggarna) All annan uppmärkning, till exempel länkningen mot SALDO, dependensparsning och en alternativ uppmärkning med namngivna entiteter (<ne>-taggar), har skapats automatiskt av Sparv. SUCX går även att utforska i Korp.
斯德哥尔摩-于默奥语料库(Stockholm-Umeå-korpus,简称SUC)是一套收录自20世纪90年代的瑞典语文本集合,总词量达100万。 该语料库为平衡语料库,即涵盖多样文本类型与不同风格层级的文本。 所有文本均已标注词类标签、形态分析结果与词元(lemma),所有此类标注均可视为参考数据,同时附带部分结构与功能信息。 1.0版本由斯德哥尔摩大学的贡内尔·凯尔格伦(Gunnel Källgren)与于默奥大学的伊娃·耶赫德(Eva Ejerhed)合作开发,并于1997年由斯德哥尔摩大学语言学系正式发布。 2.0版本由斯德哥尔摩大学语言学系的索菲亚·古斯塔夫松·卡普科娃(Sofia Gustafsson Capkova)与布里特·哈特曼(Britt Hartmann)于2006年发布。该版本保留了SUC 1.0的全部文本,但新增了部分标注内容。此外,SUC 2.0还包含两份附加材料。其中,TigerSUC是由马丁·福尔克(Martin Volk)将SUC 2.0转换为TIGER-XML格式后的产物;StorSUC则是额外收录的400万词SUC相关文本。 3.0版本自2012年起对外开放。该版本包含优化后的标注内容,同时新增了700万词的未标注文本。(注:关于TigerXML格式版本、Suc2c、Suc2d以及文档类型定义(DTD)文件,我们仍沿用版本2.0的相关资源。) 关于SUC的汇编与标注的更多细节,可查阅SUC 2.0的使用手册[PDF]。 瑞典语言银行(Språkbanken)为SUC 2.0与SUC 3.0提供两种分发版本: SUC 2.0与SUC 3.0:仅面向科研人员免费开放,需申请个人授权许可。 SUCX 2.0与SUCX 3.0:采用反转语序结构;经自动标注增强处理;可无限制下载。 SUCX 3.0 SUCX版本可通过下方链接直接以知识共享署名-相同方式共享许可协议(Creative Commons Attribution-ShareAlike,CC BY-SA)下载。该版本采用反转语序结构,同时附加了由瑞典语言银行(Språkbanken)文本分析工具自动生成的额外标注。语料库以Språkbanken标准XML格式分发。 以下标注与官方版本保持一致: 1. 词类标注(对应XML元素的pos属性) 2. 形态特征标注(对应msd属性) 3. 词元标注(对应lemma属性) 4. 命名实体标注(仅SUC 3.0版本使用<name>标签,而非<ne>标签) 其余所有标注,例如与SALDO词库的关联、依存句法分析结果,以及采用<ne>标签的备选命名实体标注方案,均由Sparv工具自动生成。 用户还可在Korp平台中探索SUCX语料库。



