TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

Created: 2026-06-03 | Tags: benchmarkcs-educationk-12multimodal

Wen et al. (2026) โ€” ArXiv. ๐Ÿ“„ Full text (arXiv)

Introduces TurtleAI benchmark (823 tasks). Finds that current VLMs (GPT-5, o3) struggle with spatial reasoning in educational graphics. Fine-tuning improves visual-code alignment. benchmark, cs-education, k-12, generative-ai, spatial-reasoning.

Related Pages

Citation

APA: Wen et al. (2026). TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics. arXiv:2606.03626.