遇见数据集

omnicoder-train

收藏
魔搭社区2026-06-03 更新2026-07-19 收录
官方服务:

资源简介:

# omnicoder-train 16178 ejemplos pre-formateados con template OFICIAL de `Tesslate/OmniCoder-9B` (Qwen3.5-9B base), filtrados a: - Con `<think>...</think>` en assistant content (thinking estructurado) - <2048 tokens (renderado con tokenizer Qwen3.5 family, vocab 248077) - Categorias: math / code / logic / coding / physics / chemistry - Dedup global por user content hash ## Sources - roman 7515 - Roman1111111/claude-opus-4.6-10000x - jirafa 5872 - angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k - nohurry 2226 - nohurry/Opus-4.6-Reasoning-3000x-filtered - teich 500 - TeichAI/Claude-Opus-4.6-Reasoning-887x - gpt55 65 - armand0e/gpt-5.5-chat ## Format JSONL with fields: - `text`: full rendered chat template (`<|im_start|>system... <|im_start|>user... <|im_start|>assistant\n<think>...</think>\n\n...`) - `n_tokens`: int - `source`: origin dataset - `category`: from source metadata - `filter_label`: cat/* or regex/* (how it matched) ## Usage ```python from datasets import load_dataset ds = load_dataset("Kukedlc/omnicoder-train", split="train") # ds[0]["text"] -> ready to train con SFTTrainer dataset_text_field="text" ```

提供机构:
maas
创建时间:
2026-06-01
二维码
社区交流群
二维码
科研交流群
商业服务