Awesome AI Agent Stack

Interpretability, Alignment & Research

Understanding and steering model behaviour.

Interpretability

Steering & model editing

RL & post-training

Alignment

Research