登录后查看消息通知
搜索
常见问题
消息
登录
首页
/
数据集
/
tokyotech-llm/MMLU-ProX-Japanese
tokyotech-llm/MMLU-ProX-Japanese
收藏
Hugging Face
2025-08-18 更新
2025-09-13 收录
多模态语言理解
日语处理
数据链接:
https://hf-mirror.com/datasets/tokyotech-llm/MMLU-ProX-Japanese
数据链接
链接失效反馈
官方服务:
问题咨询
购买咨询
在线客服
NEW
资源简介:
--- license: mit ---
应用场景:
提供机构:
tokyotech-llm
相关数据集
Innovator-VL-Instruct-46M
多模态语言理解
指令跟随
Innovator-VL-Instruct-46M 是一个多模态视觉指令数据集,旨在通过全参数视觉指令监督微调(SFT)增强模型在广泛视觉任务中的能力。该数据集设计目标包括:1)基础视觉指令跟随,使模型能够有效利用预训练知识解决多样化视觉语言理解任务;2)为强化学习阶段提供冷启动,赋予模型初步的链式思考和多步推理能力;3)增强科学领域理解能力,训练模型解决需要领域知识、结构化推理和精确答案的问题。
Hugging Face
2026-01-26 更新
46
0
GPT-4自指导数据集
语言模型微调
日语处理
GPT-4自指导数据集是由京都大学开发的高质量日语指令数据集,用于大型语言模型的监督微调。该数据集包含52,000条指令,通过将少量英语指令翻译并本地化成日语,利用GPT-4自动生成多样化的指令数据。数据集的创建过程涉及翻译、本地化编辑和自动生成,旨在解决非英语语言在大型语言模型开发中的资源不足问题,特别是在日语领域的应用。
arXiv
2024-03-06 更新
13
0
bert ja
自然语言处理
日语处理
BERT with SentencePiece for Japanese text
kaggle
2019-08-11 更新
11
0
pfnet/bbh-ja
语言模型评估
日语处理
BBH-ja是一个翻译成日语的BIG-Bench Hard数据集,旨在评估大语言模型在日语Chain of Thought能力。数据集由两部分组成:评估问题(`bbh-ja/`)和few-shot示例的提示(`cot-prompts/`)。评估问题存储在JSON Lines格式中,提示存储在YAML格式中。翻译使用了PLaMo Translation Model。
Hugging Face
2025-07-07 更新
13
0
minato-ryan/emilia-cjk-xcodec2
语音识别
日语处理
该数据集包含多个配置(ja_long,ja_short,ja_skipped,ja_very_long),每个配置都有如uid、dnsmos、时长、语言、说话人、文本、wav文件和ids等特征。每个配置的训练分割都包含了示例数量和字节数的信息。此外,还提供了每个配置的下载大小和数据集大小。
Hugging Face
2025-10-24 更新
11
0
© 2023-2026 上海数据发展科技有限责任公司 版权所有
沪ICP备17003045号-15
沪公网安备31010402336585号
热门搜索
社区交流群
科研交流群
商业服务
数据资源
寻源服务
数据采集
标注服务
数据产品
代理销售
数据领域
凭证登记
数据产品
介绍推广