M Harfi 👁 8 views

Mechanistic Interpretability

Bir sinir ağının iç katmanlarındaki hangi devrelerin, hangi kavramı nasıl temsil ettiğini tersine mühendislikle çözmeyi amaçlayan araştırma alanı.

Mechanistic interpretability (mekanik yorumlanabilirlik), bir büyük dil modelinin "kara kutu" içinde ne olup bittiğini, modelin ağırlıklarını ve aktivasyonlarını inceleyerek somut devrelere ve kavramlara ayırmayı amaçlayan araştırma alanıdır. Amaç yalnızca modelin ne yaptığını değil, bunu nasıl ve neden yaptığını anlamaktır; örneğin belirli bir nöron grubunun "Fransa'nın başkenti" kavramını nasıl kodladığını bulmak gibi. Anthropic'in bu alandaki çalışmaları, modellerin yalan söyleme, hedef saptırma veya zararlı davranışlar geliştirme potansiyelini erken tespit ederek AI güvenliğine katkı sağlamayı hedefler.