遇见数据集

Japanese Furigana and Tokenization

收藏
RapidAPI2026-06-15 更新2026-06-16 收录
官方服务:

资源简介:

Generate furigana, tokenize Japanese text, normalize input, split sentences, and create ruby HTML from a simple REST API. Get your API key at https://japanesetextapi.com

创建时间:
2026-06-15
原始信息汇总

数据集概述

名称:Japanese Furigana and Tokenization

提供者:Cody Campbell

类别:Text Analysis

定价:免费

API 版本:v1 (当前)

功能描述

该 API 提供快速的日语文本处理功能,通过简单的 REST 接口将原始日语文本转换为对学习者和应用程序友好的数据。主要功能包括:

  • 分词(Tokenizer):提供包含读音、词性信息和字符偏移量的日语分词。
  • 振假名生成(Furigana Generation):为汉字单词和短语生成振假名。
  • Ruby HTML 生成:输出用于网页和教育应用的 Ruby HTML。
  • 文本规范化(Normalization):对日语输入进行一致性处理。
  • 句子分割(Sentence Segmentation):将文章、文档和学习内容分割成句子。

端点列表

方法 端点路径 描述
POST /furigana 生成振假名
POST /segment 句子分割
POST /normalize 文本规范化
POST /ruby-html Ruby HTML 生成
POST /tokenize 分词
GET /health 健康检查

常见用例

  • 日语语言学习应用程序
  • 振假名阅读器和浏览器扩展
  • 电子书和网络小说工具
  • 闪卡生成系统
  • 日语 OCR 后处理流水线
  • 内容管理系统
  • 自然语言处理与语言分析项目
  • 教育网站和学习平台

示例输入输出

  • 输入私は日本語を勉強しています。
  • 振假名输出わたしはにほんごをべんきょうしています。
  • Ruby HTML 输出<ruby>私<rt>わたし</rt></ruby>は<ruby>日本語<rt>にほんご</rt></ruby>を<ruby>勉強<rt>べんきょう</rt></ruby>しています。
  • 结构化分词数据:包含读音和词性信息。

使用约束

  • 认证方式:通过 x-api-key 标头传递 API 密钥(服务端 SHA-256 哈希)
  • 请求格式:所有 POST 端点必须使用 Content-Type: application/json
  • 最大请求体大小:128 KB
  • 最大文本长度:10,000 个字符
  • CORS:允许所有来源

常见错误响应

  • 401 Missing/Invalid API Key{"error": {"code": "missing_api_key", "message": "Missing API key."}}
  • 429 Usage Limit Exceeded{"error": {"code": "usage_limit_exceeded", "message": "Monthly character limit reached. Upgrade or wait until reset."}}
  • 400 Invalid Body{"error": {"code": "text_required", "message": "Field "text" is required and must be a string."}}
  • 413 Body Too Large{"error": {"code": "body_too_large", "message": "Request body exceeds 128KB."}}

其他信息

搜集汇总
数据集介绍
Japanese Furigana and Tokenization 数据集图片
背景与挑战
背景概述
该数据集提供日语文本处理功能,包括生成注音(furigana)、分词、文本规范化、句子分割以及创建ruby HTML。用户可通过REST API调用,并在japanesetextapi.com获取API密钥。
以上内容由遇见数据集搜集并总结生成
二维码
社区交流群
二维码
科研交流群
商业服务