Wen et al. (2026) โ ArXiv. ๐ Full text (arXiv)
Introduces TurtleAI benchmark (823 tasks). Finds that current VLMs (GPT-5, o3) struggle with spatial reasoning in educational graphics. Fine-tuning improves visual-code alignment. benchmark, cs-education, k-12, generative-ai, spatial-reasoning.
Related Pages
- ai-literacy โ Literacy frameworks
- scaffolding โ Educational scaffolding techniques
- intelligent-tutoring โ ITS research
- cs-education โ Computer science pedagogy
- mastery-learning โ Independent learning goals