🤏 Smol-Data Collection Tried and tested mixes for strong pretraining. Inspired by https://huggingface.co/blog/codelion/optimal-dataset-mixing • 14 items • Updated Mar 2 • 21
Speculative Pipeline Decoding: Higher-Accruacy and Zero-Bubble Speculation via Pipeline Parallelism Paper • 2605.30852 • Published May 29 • 8
Running on Zero Agents LFM2.5 Encoder 350M Corpus Cleaner 🧹 LFM2.5 delete-only cleaner for pretraining data
Running on Zero Agents LFM2.5 Encoder 350M Corpus Cleaner 🧹 LFM2.5 delete-only cleaner for pretraining data