// category · 8 tools · 6 open source
Interpretability
Libraries and platforms for opening the black box — hooking activations, training sparse autoencoders, attributing outputs and publishing circuit-level findings.
// category · 8 tools · 6 open source
Libraries and platforms for opening the black box — hooking activations, training sparse autoencoders, attributing outputs and publishing circuit-level findings.