Research Idea
Could CoT prompts be learned rather than hand-written?
The paper uses manually written CoT examples. Auto-CoT (Zhang et al. 2022) clusters questions and generates demonstrations automatically. An interesting extension: can we use RL to optimize CoT traces end-to-end for a target task, rather than searching over discrete exemplar sets?