flâneur — a map of the web's best reading

Cross-Model Activation Generalizability Isn't Strong (Yet) — LessWrong

lesswrong.com · 3,941 words · saved by 1 readers

TL;DR * Tested activation similarities across different LLM families (Llama, Gemma, Qwen, Pythia) at small scale (1~3B) * CKA Similarity : Cross-ar…

x Cross-Model Activation Generalizability Isn't Strong (Yet) — LessWrong Interpretability (ML & AI) AI Frontpage 6 Cross-Model Activation Generalizability Isn't Strong (Yet) by J Lee 6th Apr 2026 17 min read 0 6 TL;DR Tested activation similarities across different LLM families (Llama, Gemma, Qwen, Pythia) at small scale (1~3B) CKA Similarity : Cross-architectural activation similarity is statistically real, but weak. Within-family activations are much stronger (4~9x) Linear Transferability : Trained linear bridges for linear activation transfers for binary classification and next token predic

Explore this link on the map →

related reading