Σώμα κειμένων της Νέας Ελληνικής για τη μελέτη των συγκρίσεων ομοιότητας [san-Corpus]
收藏资源简介:
Ο γλωσσικός πόρος san-Corpus περιλαμβάνει σώμα κειμένων γραπτού λόγου της Νέας Ελληνικής, έκτασης περίπου 9 εκατομμυρίων λέξεων. Ο πόρος συγκροτήθηκε στο πλαίσιο διδακτορικής διατριβής, με στόχο τη μελέτη των συγκρίσεων ομοιότητας στη Νέα Ελληνική. Μέγεθος & Πηγές Το corpus περιλαμβάνει τρία ισομεγέθη υποσώματα, ώστε να επιτρέπονται οι συγκρίσεις μεταξύ τους: (α) Δημοσιογραφικός Λόγος: 7.774 άρθρα από τέσσερις διαδικτυακές εφημερίδες (Η ΑΥΓΗ, Η ΚΑΘΗΜΕΡΙΝΗ, ΕΘΝΟΣ, ΤΟ ΒΗΜΑ - έτος 2015). Συνολική Έκταση: 2,9 εκατ. λέξεις. (β) Εκπαιδευτικός Λόγος: 96 σχολικά εγχειρίδια δημοτικού και γυμνασίου. Συνολική Έκταση: 3,4 εκατ. λέξεις (μελετώνται 2,8 εκατ.). (γ) Λογοτεχνικός Λόγος: 28 μυθιστορήματα (βραβεία αναγνωσιμότητας περιόδου 2010-2015). Συνολική Έκταση: 2,5 εκατ. λέξεις. Κατανομή Σχολικών Εγχειριδίων ανά Γνωστικό Αντικείμενο Πλήθος Εγχειριδίων Ελληνική Λογοτεχνία 13 Ελληνική Γλώσσα 12 Ιστορία 9 Φυσική – Χημεία – Βιολογία 9 Μαθηματικά 9 Γεωγραφία – Γεωλογία – Περιβάλλον 8 Θρησκευτικά 7 Αγωγή Αισθητική (Εικαστικά – Μουσική – Θέατρο) 15 Αγωγή Υγείας (Φυσική Αγωγή – Οικιακή Οικονομία) 5 Πληροφορική – Τεχνολογία 5 Αγωγή Κοινωνική – Πολιτική 3 Αγωγή Σταδιοδρομίας (ΣΕΠ) 1 Κατάλογος μυθιστορημάτων: Συγγραφέας, Τίτλος Έτος 1ης έκδοσης Δούκα, Μάρω - Το δίκιο είναι ζόρικο πολύ 2010 Θέμελης, Νίκος - Η συμφωνία των ονείρων 2010 Καρυστιάνη, Ιωάννα - Τα σακιά 2010 Μιχαλοπούλου, Αμάντα - Πώς να κρυφτείς 2010 Ελευθερίου, Μάνος - Πριν απ' το ηλιοβασίλεμα 2011 Ζουργός, Ισίδωρος - Ανεμώλια 2011 Μακριδάκης, Γιάννης - Η άλωση της Κωνσταντίας 2011 Μπουραζοπούλου, Ιωάννα - Η ενοχή της αθωότητας 2011 Πανσέληνος, Αλέξης - Σκοτεινές επιγραφές 2011 Παπαδημητρίου, Χίλντα - Για μια χούφτα βινύλια 2011 Παπαθεοδώρου, Θοδωρής - Οι καιροί της μνήμης 2011 Τριανταφύλλου, Σώτη - Για την αγάπη της γεωμετρίας 2011 Φακίνος, Μιχάλης - Η έρημος έρχεται 2011 Βαμβουνάκη, Μάρω - Κυριακή απόγευμα στη Βιέννη 2012 Διβάνη, Λένα - Εγώ, ο Ζάχος Ζάχαρης 2012 Στεφανάκης, Δημήτρης - Φιλμ νουάρ 2012 Ακρίβος, Κώστας - Αλλάζει πουκάμισο το φίδι 2013 Ζέη, Άλκη - Με μολύβι φάμπερ νούμερο δύο 2013 Κορτώ, Αύγουστος - Το βιβλίο της Κατερίνας 2013 Κωνσταντούρου, Μαρία - Αγεφύρωτες σιωπές 2013 Μαντά, Λένα - Με λένε Ντάτα 2013 Ξανθούλης, Γιάννης - Κωνσταντινούπολη των ασεβών μου φόβων 2013 Ρώσση–Ζαΐρη, Ρένα - Άρωμα βανίλιας 2013 Ανδρουλάκης, Μίμης - Αλλέγκρα 2014 Δημουλίδου, Χρυσηίδα - Το κελάρι της ντροπής 2014 Παπαδοπούλου, Ελισάβετ - Μέρες και νύχτες που δεν ήταν δικές μας 2014 Χατζή, Αθηνά - Η θάλασσα έφυγε 2014 Χωμενίδης, Χρήστος - Νίκη 2014 Τεχνικές προδιαγραφές & Μορφότυπος Για την αναπαράσταση των δεδομένων και των μεταδεδομένων υιοθετήθηκε η πολυεπίπεδη οπτική των XML σχημάτων και τροποποιήθηκε το διεθνές πρότυπο TEI P5, 4.0.0 (Text Encoding Initiative). Δημιουργήθηκε ειδικός χώρος ονομάτων sanCorpus (sanC) με σχήμα τύπου RELAX-NG. Το σώμα κειμένων διατίθεται σε TXT και σε XML σε τρεις εκδοχές: Βάθος 0: απλό κείμενο (TXT). Περιλαμβάνει το main core (κείμενο βάσει του οποίου εξετάζονται οι συγκρίσεις ομοιότητας) και το out of core (κείμενο εκτός εμβέλειας της διατριβής, στο οποίο περιλαμβάνονται κείμενα που πλαισιώνουν το κυρίως κείμενο, π.χ. κείμενα διδασκαλίας, πίνακες περιεχομένων, εξώφυλλα) Βάθος 1 = κείμενα στην απλούστερη δυνατή XML κωδικοποίηση Βάθος 2 = κείμενα με πιο λεπτομερείς XML κωδικοποιήσεις. Αυτή η έκδοση (san-Corpus v1.0, Depth 0: Plain Text) περιλαμβάνει το σώμα κειμένων σε μορφή απλού κειμένου (Βάθος 0) στην αρχική του διάταξη (βλ. Επεξεργασία). Στόχος είναι ο σταδιακός εμπλουτισμός με επισημειωμένα δεδομένα, καθώς και με τις εκδοχές Βάθους 1 και 2. Επεξεργασία (Processing) Η μεθοδολογία συλλογής των δεδομένων, η θεωρητική τεκμηρίωση και το σχήμα επισημείωσης επεξηγούνται στις μελέτες Αφεντουλίδου (2022, 2021, 2013, 2012) και Afentoulidou (2009). Η πρώτη εκδοχή (Βάθος 0) χρησιμοποιήθηκε αποκλειστικά για τη λημματοποίηση που απαιτούσε η Collostruction Analysis (Gries, 2024). Στάδια επεξεργασίας (για τη λημματοποίηση): Τμηματοποίηση σε προτάσεις (sentence segmentation) με τη χρήση της βιβλιοθήκης Stanza (Stanford NLP Group, Qi et al. 2020), η οποία βασίζεται στο μοντέλο Greek Dependency Treebank (GDT) του Ινστιτούτου Επεξεργασίας του Λόγου / ΕΚ «Αθηνά». Τυχαία αναδιάταξη των προτάσεων για την προστασία της ακεραιότητας των πρωτότυπων έργων. Λημματοποίηση με τον ILSP Lemmatizer μέσω της Υποδομής Clarin-EL. Για την ανάλυση συμφράσεων του δείκτη σαν απομονώθηκαν συγκεκριμένοι λεκτικοί τύποι. Αδειοδότηση & Δικαιώματα Το san-Corpus συγκροτήθηκε για τις ανάγκες της διδακτορικής διατριβής και προστατεύεται από το δικαίωμα ειδικής φύσης σύμφωνα με την Οδηγία 96/9/ΕΟΚ και το άρθρο 45Α του Ν. 2121/1993. Η χρήση του περιεχομένου γίνεται αποκλειστικά για ερευνητικούς σκοπούς βάσει των εξαιρέσεων της Οδηγίας 2001/29 και της Οδηγίας (ΕΕ) 2019/790 (Text and Data Mining exceptions / Fair Use). Η πρόσβαση είναι περιορισμένη (Restricted Access) και παρέχεται αποκλειστικά σε μέλη της ακαδημαϊκής κοινότητας για σκοπούς επαλήθευσης των αποτελεσμάτων της διατριβής και περαιτέρω μη εμπορική έρευνα. Η πηγή προέλευσης δικαιούται να ζητήσει οποιαδήποτε τροποποιητική ενέργεια (π.χ. αφαίρεση) επί του πρωτότυπου περιεχομένου. Τέλος, η άδεια CC BY-NC-ND 4.0 ισχύει για την επιμέλεια (curation), τα μεταδεδομένα και τη γλωσσολογική επισημείωση του σώματος κειμένων. Βιβλιογραφικές αναφορές Αφεντουλίδου, Β. (2022). Σώμα ελληνικών κειμένων για τη μελέτη δομών ομοιότητας της Νέας Ελληνικής: σχεδιασμός και υλοποίηση. Στο Πρακτικά του 10ου Συνεδρίου Μεταπτυχιακών Φοιτητών και Υποψηφίων Διδακτόρων του Τμήματος Φιλολογίας (σσ. 67-94). ΕΚΠΑ. Αφεντουλίδου, B. (2021). Δομές ομοιότητας στη Νέα Ελληνική. Σωματοκειμενικές παρατηρήσεις για τον πολυλειτουργικό δείκτη σαν. Προφορική ανακοίνωση στην 41η Ετήσια Συνάντηση του Τομέα Γλωσσολογίας, 13–15 Μαΐου 2021. ΑΠΘ. Αφεντουλίδου, Β. (2013). Και σου απάντησα κάτι σαν ‘τέλεια, εντάξει’. Δείκτης σαν + ευθύς λόγος;. Προφορική ανακοίνωση στο 7ο Συνέδριο Μεταπτυχιακών Φοιτητών και Υποψηφίων Διδακτόρων του Τμήματος Φιλολογίας, 16–18 Μαΐου. ΕΚΠΑ. Αφεντουλίδου, Β. (2012). Συγκρίσεις ομοιότητας στα Νέα Ελληνικά: ο δείκτης σαν. Στο Z. Gavriilidou, A. Efthymiou, E. Thomadaki & P. Kambakis-Vougiouklis (Επιμ.), Selected papers of the 10th International Conference on Greek Linguistics (σσ. 696-707). DUTH. Afentoulidou, V. (2009). Sketching the σαν conditional construction in Modern Greek. Submitted essay, 2009 Linguistic Institute, Linguistic Structure and Language Ecologies, Linguistic Society of America and UC Berkeley. Gries, Stefan Th. 2024. Coll.analysis 4.1. A script for R to compute perform collostructional analyses. https://www.stgries.info/teaching/groningen/index.html Institute for Language and Speech Processing - Athena Research Center (2015). ILSP Lemmatizer. Version 1. [Software (Tool/Service)]. CLARIN:EL. http://hdl.handle.net/11500/ATHENA-0000-0000-23EE-D Qi, P., Zhang, Y., Zhang, Y., Bolton, J., & Manning, C. D. (2020). Stanza: A Python Natural Language Processing Toolkit for Many Human Languages. In Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics: System Demonstrations (pp. 101–108). Online: Association for Computational Linguistics.
san-Corpus语料库(san-Corpus)收录了约900万词的现代希腊语书面文本集合。该语料库为博士学位论文研究项目所构建,旨在开展现代希腊语的相似性对比研究。 规模与来源 该语料库包含三个规模均等的子语料库,以便开展跨子库对比研究: (1) 新闻文本:来自4家在线报纸《Η ΑΥΓΗ》、《Η ΚΑΘΗΜΕΡΙΝΗ》、《ΕΘΝΟΣ》、《ΤΟ ΒΗΜΑ》的7774篇文章,采集年份为2015年,总词量达290万。 (2) 教育文本:96本小学和中学教科书,总词量约340万(其中可用于分析的词量为280万)。 (3) 文学文本:28部获得2010-2015年可读性奖项的长篇小说,总词量约250万。 中小学教科书按学科分类统计 学科分类 | 教科书数量 --- | --- 希腊文学 | 13 希腊语语言 | 12 历史 | 9 物理-化学-生物 | 9 数学 | 9 地理-地质-环境 | 8 宗教 | 7 审美教育(美术-音乐-戏剧) | 15 健康教育(体育-家政) | 5 信息技术-科技 | 5 社会-政治教育 | 3 职业指导教育(ΣΕΠ) | 1 长篇小说目录:作者、作品名(首版年份) Δούκα, Μάρω - Το δίκιο είναι ζόρικο πολύ,2010 Θέμελης, Νίκος - Η συμφωνία των ονείρων,2010 Καρυστιάνη, Ιωάννα - Τα σακιά,2010 Μιχαλοπούλου, Αμάντα - Πώς να κρυφτείς,2010 Ελευθερίου, Μάνος - Πριν απ' το ηλιοβασίλεμα,2011 Ζουργός, Ισίδωρος - Ανεμώλια,2011 Μακριδάκης, Γιάννης - Η άλωση της Κωνσταντίας,2011 Μπουραζοπούλου, Ιωάννα - Η ενοχή της αθωότητας,2011 Πανσέληνος, Αλέξης - Σκοτεινές επιγραφές,2011 Παπαδημητρίου, Χίλντα - Για μια χούφτα βινύλια,2011 Παπαθεοδώρου, Θοδωρής - Οι καιροί της μνήμης,2011 Τριανταφύλλου, Σώτη - Για την αγάπη της γεωμετρίας,2011 Φακίνος, Μιχάλης - Η έρημος έρχεται,2011 Βαμβουνάκη, Μάρω - Κυριακή απόγευμα στη Βιέννη,2012 Διβάνη, Λένα - Εγώ, ο Ζάχος Ζάχαρης,2012 Στεφανάκης, Δημήτρης - Φιλμ νουάρ,2012 Ακρίβος, Κώστας - Αλλάζει πουκάμισο το φίδι,2013 Ζέη, Άλκη - Με μολύβι φάμπερ νούμερο δύο,2013 Κορτώ, Αύγουστος - Το βιβλίο της Κατερίνας,2013 Κωνσταντούρου, Μαρία - Αγεφύρωτες σιωπές,2013 Μαντά, Λένα - Με λένε Ντάτα,2013 Ξανθούλης, Γιάννης - Κωνσταντινούπολη των ασεβών μου φόβων,2013 Ρώσση–Ζαΐρη, Ρένα - Άρωμα βανίλιας,2013 Ανδρουλάκης, Μίμης - Αλλέγκρα,2014 Δημουλίδου, Χρυσηίδα - Το κελάρι της ντροπής,2014 Παπαδοπούλου, Ελισάβετ - Μέρες και νύχτες που δεν ήταν δικές μας,2014 Χατζή, Αθηνά - Η θάλασσα έφυγε,2014 Χωμενίδης, Χρήστος - Νίκη,2014 技术规范与格式 为实现数据与元数据的结构化表示,本语料库采用XML分层架构,并对国际文本编码标准TEI P5 4.0.0(Text Encoding Initiative,文本编码倡议)进行了适配改造。同时创建了专属命名空间sanCorpus(sanC),采用RELAX-NG格式规范。 文本集合提供TXT与XML两种格式,共三个版本: 层级0:纯文本(TXT)。包含核心文本(用于相似性对比研究的主体文本)与非核心文本(超出论文研究范围的辅助文本,例如教学材料、目录、封面等)。 层级1:采用最简XML编码的文本。 层级2:采用精细化XML编码的文本。 本版本(san-Corpus v1.0,层级0:纯文本)收录了初始排版的纯文本格式文本集合(详见「处理流程」部分)。未来将逐步增补标注数据以及层级1、层级2版本的语料。 处理流程 数据采集方法、理论依据与标注规范详见Αφεντουλίδου(2022、2021、2013、2012)与Afentoulidou(2009)的相关研究。 本语料库的首个版本(层级0)仅用于配合构式搭配分析(Collostruction Analysis,Gries, 2024)所需的词形还原操作。 词形还原处理流程如下: 1. 分句处理:使用Stanza自然语言处理库(Stanza NLP Group, Qi et al. 2020)进行句子分割,该工具基于希腊语依赖树库(Greek Dependency Treebank, GDT)训练,由语言与语音处理研究所/雅典娜研究中心开发。 2. 随机打乱句子顺序:以保护原作品的完整性。 3. 词形还原:通过Clarin-EL基础设施调用ILSP词形还原工具(ILSP Lemmatizer)完成。 为分析希腊语“σαν”结构的搭配模式,筛选了特定词性的词汇类型。 授权与版权 san-Corpus语料库为博士学位论文研究项目构建,依据欧盟指令96/9/EC与希腊第2121/1993号法律第45A条,受特殊版权保护。其内容仅可用于学术研究,符合欧盟指令2001/29与(EU)2019/790规定的文本与数据挖掘豁免条款(Fair Use,合理使用)。 本语料库采用受限访问模式(Restricted Access),仅向学术共同体成员开放,用于验证论文研究结果及非盈利性后续研究。语料库来源方有权要求对原始内容进行任何修改(例如删除操作)。 此外,语料库的整理工作、元数据及语言学标注内容采用CC BY-NC-ND 4.0授权协议。 参考文献 Αφεντουλίδου, Β. (2022). 现代希腊语相似性结构研究语料库:设计与实现. 载于《第10届文学院硕士研究生与博士候选人会议论文集》(第67-94页). 雅典大学(ΕΚΠΑ). Αφεντουλίδου, Β. (2021). 现代希腊语的相似性结构:关于多功能标记词“σαν”的语料库观察. 载于第41届语言学分会年度会议论文集(2021年5月13-15日). 塞萨洛尼基大学(ΑΠΘ). Αφεντουλίδου, Β. (2013). 当我说“完全没问题”:标记词“σαν”+直接引语结构研究. 载于《第7届文学院硕士研究生与博士候选人会议论文集》(2013年5月16-18日). 雅典大学(ΕΚΠΑ). Αφεντουλίδου, Β. (2012). 现代希腊语的相似性对比:标记词“σαν”的研究. 载于Z. Gavriilidou, A. Efthymiou, E. Thomadaki & P. Kambakis-Vougiouklis(编), 《第10届国际希腊语言学会议论文选集》(第696-707页). 德谟克利特大学色雷斯分校(DUTH). Afentoulidou, V. (2009). Sketching the σαν conditional construction in Modern Greek. 提交论文,2009年美国语言学学会语言学院:语言结构与语言生态项目. Gries, Stefan Th. 2024. Coll.analysis 4.1. A script for R to compute perform collostructional analyses. https://www.stgries.info/teaching/groningen/index.html Institute for Language and Speech Processing - Athena Research Center (2015). ILSP Lemmatizer. Version 1. [软件工具/服务]. CLARIN:EL. http://hdl.handle.net/11500/ATHENA-0000-0000-23EE-D Qi, P., Zhang, Y., Zhang, Y., Bolton, J., & Manning, C. D. (2020). Stanza: A Python Natural Language Processing Toolkit for Many Human Languages. 载于《第58届计算语言学协会年会论文集:系统演示》(第101-108页). 线上发布:计算语言学协会.



