It is a dataset for fine-tuning LLMs to solve 24(puzzle)
reflection dataset reasoning cot sft large-language-models llm chain-of-thought llm-training qwen llm4math 24puzzle reasoning-language-models
-
Updated
Mar 23, 2025 - Python