jaygala24/indic_sts
收藏资源简介:
--- annotations_creators: - crowdsourced language_creators: - crowdsourced - found - machine-generated language: - as - bn - en - gu - hi - kn - ml - mr - or - pa - ta - te - ur license: - cc0-1.0 multilinguality: - multilingual size_categories: - 1K<n<10K task_categories: - text-classification task_ids: - text-scoring - semantic-similarity-scoring pretty_name: Indic STS dataset_info: - config_name: en-as features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 167751 num_examples: 656 download_size: 83024 dataset_size: 167751 - config_name: en-bn features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 280422 num_examples: 957 download_size: 133859 dataset_size: 280422 - config_name: en-gu features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 217276 num_examples: 780 download_size: 105617 dataset_size: 217276 - config_name: en-hi features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 458019 num_examples: 1268 download_size: 224825 dataset_size: 458019 - config_name: en-kn features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 291586 num_examples: 953 download_size: 140273 dataset_size: 291586 - config_name: en-ml features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 302856 num_examples: 947 download_size: 139777 dataset_size: 302856 - config_name: en-mr features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 253059 num_examples: 779 download_size: 124599 dataset_size: 253059 - config_name: en-or features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 121019 num_examples: 500 download_size: 57149 dataset_size: 121019 - config_name: en-pa features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 204730 num_examples: 688 download_size: 102251 dataset_size: 204730 - config_name: en-ta features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 368438 num_examples: 1044 download_size: 162846 dataset_size: 368438 - config_name: en-te features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 291129 num_examples: 948 download_size: 138528 dataset_size: 291129 - config_name: en-ur features: - name: lang_code dtype: string - name: source dtype: string - name: english_sentence dtype: string - name: indic_sentence dtype: string - name: score dtype: float64 splits: - name: test num_bytes: 150870 num_examples: 500 download_size: 85405 dataset_size: 150870 configs: - config_name: en-as data_files: - split: test path: en-as/test-* - config_name: en-bn data_files: - split: test path: en-bn/test-* - config_name: en-gu data_files: - split: test path: en-gu/test-* - config_name: en-hi data_files: - split: test path: en-hi/test-* - config_name: en-kn data_files: - split: test path: en-kn/test-* - config_name: en-ml data_files: - split: test path: en-ml/test-* - config_name: en-mr data_files: - split: test path: en-mr/test-* - config_name: en-or data_files: - split: test path: en-or/test-* - config_name: en-pa data_files: - split: test path: en-pa/test-* - config_name: en-ta data_files: - split: test path: en-ta/test-* - config_name: en-te data_files: - split: test path: en-te/test-* - config_name: en-ur data_files: - split: test path: en-ur/test-* tags: - multilingual - semantic-textual-similarity --- # Dataset Card for Indic STS This dataset is STS benchmark between English and 12 high-resource Indic languages. This was released as a part of [Samanantar](https://arxiv.org/abs/2104.05596) paper. Please refer to the paper for more details. ### Languages Available languages are: en-as, en-bn, en-gu, en-hi, en-kn, en-ml, en-mr, en-or, en-pa, en-ta, en-te, en-ur ### Dataset Structure #### Dataset Fields - lang_code: 2-digit ISO language code - source: The source from which the candidate sentence is considered. - english_sentence: The full sentence in the English language. - indic_sentence: The full sentence in the corresponding Indic language. - score: The similarity score as a float which is <= 5.0 and >= 0.0. #### Data Instances ```json { "lang_code":"hi", "source":"CatchNews", "english_sentence":"\"...this is only an interim measure and as long as we have hopefully control over COVID in a few months or a year\\'s time then I think things will go back to as normal as it can be,\" Kumble said\n", "indic_sentence":"उन्होंने कहा,\"यह केवल एक अंतरिम उपाय है और जब तक हम कुछ महीनों या एक साल के समय में COVID-19 पर नियंत्रण करते हैं, तब तक मुझे लगता है कि चीजें फिर से सामान्य हो जाएंगी\n", "score":4.0 } ``` #### Splits | | en-as | en-bn | en-gu | en-hi | en-kn | en-ml | en-mr | en-or | en-pa | en-ta | en-te | en-ur | |------|-------|-------|-------|-------|-------|-------|-------|-------|-------|-------|-------|-------| | test | 656 | 957 | 780 | 1268 | 953 | 947 | 779 | 500 | 688 | 1044 | 948 | 500 | ### Examples of Use ```python3 from datasets import load_dataset dataset = load_dataset("jaygala24/indic_sts", name="en-hi", split="test") ``` ### Citation ```bibtex @article{DBLP:journals/tacl/RameshDBJASSDJK22, author = {Gowtham Ramesh and Sumanth Doddapaneni and Aravinth Bheemaraj and Mayank Jobanputra and Raghavan AK and Ajitesh Sharma and Sujit Sahoo and Harshita Diddee and Mahalakshmi J and Divyanshu Kakwani and Navneet Kumar and Aswin Pradeep and Srihari Nagaraj and Deepak Kumar and Vivek Raghavan and Anoop Kunchukuttan and Pratyush Kumar and Mitesh Shantadevi Khapra}, title = {Samanantar: The Largest Publicly Available Parallel Corpora Collection for 11 Indic Languages}, journal = {Trans. Assoc. Comput. Linguistics}, volume = {10}, pages = {145-162}, year = {2022}, url = {https://doi.org/10.1162/tacl\_a\_00452}, doi = {10.1162/TACL\_A\_00452}, timestamp = {Wed, 29 Jun 2022 16:03:22 +0200}, biburl = {https://dblp.org/rec/journals/tacl/RameshDBJASSDJK22.bib}, bibsource = {dblp computer science bibliography, https://dblp.org} } ```
Indic STS 数据集概述
数据集基本信息
- 名称: Indic STS
- 语言: 多语言,包括 as, bn, en, gu, hi, kn, ml, mr, or, pa, ta, te, ur
- 许可证: cc0-1.0
- 大小: 每个配置数据集大小在 1K<n<10K 范围内
- 任务类别: 文本分类
- 具体任务: 文本评分, 语义相似度评分
数据集结构
数据集字段
- lang_code: 2-digit ISO 语言代码
- source: 候选句子的来源
- english_sentence: 英语完整句子
- indic_sentence: 对应印度语言的完整句子
- score: 相似度分数,范围为 0.0 至 5.0
数据集分割
| en-as | en-bn | en-gu | en-hi | en-kn | en-ml | en-mr | en-or | en-pa | en-ta | en-te | en-ur | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| test | 656 | 957 | 780 | 1268 | 953 | 947 | 779 | 500 | 688 | 1044 | 948 | 500 |
数据集示例
json { "lang_code":"hi", "source":"CatchNews", "english_sentence":""...this is only an interim measure and as long as we have hopefully control over COVID in a few months or a year\s time then I think things will go back to as normal as it can be," Kumble said ", "indic_sentence":"उन्होंने कहा,"यह केवल एक अंतरिम उपाय है और जब तक हम कुछ महीनों या एक साल के समय में COVID-19 पर नियंत्रण करते हैं, तब तक मुझे लगता है कि चीजें फिर से सामान्य हो जाएंगी ", "score":4.0 }




