PulseAugur
EN
LIVE 18:49:05

SupraLabs releases 5M-sample reasoning dataset for small LLMs

SupraLabs has released a new dataset called reasoning-corpus-4K-5M-v1, containing 5 million samples designed to help train smaller language models in reasoning capabilities. The dataset includes user prompts, detailed thought traces, and AI model answers, all formatted in ChatML and within a 5k sequence length for efficient fine-tuning. This resource is available on Hugging Face and has already seen significant early adoption. AI

IMPACT Provides a specialized dataset to improve reasoning capabilities in smaller language models, potentially enabling more efficient and capable on-device AI.

RANK_REASON Release of a new dataset for training AI models. [lever_c_demoted from research: ic=1 ai=1.0]

Read on r/LocalLLaMA →

AI-generated summary · Google Gemini · from 1 sources. How we write summaries →

SupraLabs releases 5M-sample reasoning dataset for small LLMs

COVERAGE [1]

  1. r/LocalLLaMA TIER_1 English(EN) · /u/LH-Tech_AI ·

    [BIG DATASET RELEASE] - SupraLabs/reasoning-corpus-4K-5M-v1 - Train your tiny SLMs to think!

    <table> <tr><td> <a href="https://www.reddit.com/r/LocalLLaMA/comments/1v58oni/big_dataset_release/"> <img alt="[BIG DATASET RELEASE] - SupraLabs/reasoning-corpus-4K-5M-v1 - Train your tiny SLMs to think!" src="https://preview.redd.it/b7ybs7nqx5fh1.png?width=140&amp;height=58&amp…