Can sparse autoencoders be used to decompose and interpret steering vectors?
Code coming soon!
Code for the paper "Can sparse autoencoders be used to decompose and interpret steering vectors?"