TASE
收藏资源简介:
TASE是一个全面的语言模型评估基准,旨在测试模型在细粒度、标记级理解和结构推理方面的能力。它覆盖了中文、英文和韩文三种语言,包括标记感知和结构理解两个核心类别下的10个任务。数据集包含35,927个实例,并有一个可扩展的合成数据生成管道用于训练。这些任务包括字符计数、标记对齐、句法结构解析和长度约束满足等。
TASE is a comprehensive language model evaluation benchmark developed to assess models' capabilities in fine-grained, token-level understanding and structural reasoning. It covers three languages: Chinese, English and Korean, and includes 10 tasks under two core categories: token-aware understanding and structural understanding. The dataset contains 35,927 instances, and is equipped with a scalable synthetic data generation pipeline for model training. The covered tasks include character counting, token alignment, syntactic structure parsing, length constraint satisfaction, among others.
TASE Benchmark for Token-Aware & Structured Evaluation
数据集概述
TASE是一个多语言基准测试,用于评估大型语言模型(LLMs)在细粒度token感知和结构化推理方面的能力。
数据集类别
- Token Awareness(Token感知)
- 任务:
diff_tokens,freq_count,sentence_length,shuffle_tokens,sort_lengths
- 任务:
- Token Structure(Token结构)
- 任务:
component_count,component_split,dot_matrix,structure_riddle,variant_normalize
- 任务:
数据集内容
- 合成数据管道:位于
tasks/和generate_code/目录下。 - YAML配置文件:存储在
yamls/目录下。 - 自动评估脚本:位于
evaluate/目录下。
数据集结构
├─data/ # 预生成的评估集和示例输出 ├─evaluate/ # 评分和批量评估工具 │ ├─run_eval.py # 评估一个模型在一个YAML配置上的表现 │ └─batch_eval.py # 批量评估多个模型/配置 ├─tasks/ # 每个任务的源代码和资源 │ ├─token_awareness/ │ └─token_structure/ └─yamls/ # 所有YAML配置文件
快速开始
-
环境设置 bash python -m venv .venv && source .venv/bin/activate pip install -r requirements.txt
-
运行单个评估 bash python evaluate/run_eval.py --config yamls/<your_config>.yaml
-
评分现有模型输出 bash python evaluate/batch_eval.py --input_dir output/ --output_dir output_metric/
YAML配置
- 提供者类型:
hf(HuggingFace)、api(远程API)、vllm(本地vLLM)。 - 模型名称或路径:根据提供者类型选择。
- 生成参数:包括温度、最大token数、top-p阈值等。
- 特定提供者参数:如HuggingFace的
trust_remote_code、vLLM的max_model_len等。
数据集生成管道
如需重新生成数据集,进入任务的generate_code/目录并运行相应的Python脚本。生成的数椐集将出现在对应的dataset/文件夹中。

- 1TASE: Token Awareness and Structured Evaluation for Multilingual Language Models北京大学 · 2025年



