Introduction To Mechanistic Interpretability AI Safety Fundamentals: Alignment podcast

Artwork

Tech Society Philosophy Blue Dot Impact

Контент предоставлен BlueDot Impact. Весь контент подкастов, включая эпизоды, графику и описания подкастов, загружается и предоставляется непосредственно компанией BlueDot Impact или ее партнером по платформе подкастов. Если вы считаете, что кто-то использует вашу работу, защищенную авторским правом, без вашего разрешения, вы можете выполнить процедуру, описанную здесь https://ru.player.fm/legal.

AI Safety Fundamentals: Alignment »
Introduction to Mechanistic Interpretability

27d ago 11:45

Поделиться

MP3•Главная эпизода

Fetch error

Hmmm there seems to be a problem fetching this series right now. Last successful fetch was on January 02, 2025 12:05 (27d ago)

What now? This series will be checked again in the next hour. If you believe it should be working, please verify the publisher's feed link below is valid and includes actual episode links. You can contact support to request the feed be immediately fetched.

Контент предоставлен BlueDot Impact. Весь контент подкастов, включая эпизоды, графику и описания подкастов, загружается и предоставляется непосредственно компанией BlueDot Impact или ее партнером по платформе подкастов. Если вы считаете, что кто-то использует вашу работу, защищенную авторским правом, без вашего разрешения, вы можете выполнить процедуру, описанную здесь https://ru.player.fm/legal.

Our introduction introduces common mech interp concepts, to prepare you for the rest of this session's resources.

Original text: https://aisafetyfundamentals.com/blog/introduction-to-mechanistic-interpretability/
Author(s): Sarah Hastings-Woodhouse

A podcast by BlueDot Impact.
Learn more on the AI Safety Fundamentals website.

… continue reading

Разделы

1. Introduction to Mechanistic Interpretability (00:00:00)

2. Why might mechanistic interpretability be useful? (00:01:16)

3. Looking inside neural networks (00:03:34)

4. What makes mechanistic interpretability hard? (00:06:33)

5. Addressing polysemanticity (00:08:34)

85 эпизодов

#Tech #Society #Philosophy #Blue Dot Impact

Artwork

Introduction to Mechanistic Interpretability

AI Safety Fundamentals: Alignment

published 27d ago

Поделиться

MP3•Главная эпизода

Fetch error

Hmmm there seems to be a problem fetching this series right now. Last successful fetch was on January 02, 2025 12:05 (27d ago)

What now? This series will be checked again in the next hour. If you believe it should be working, please verify the publisher's feed link below is valid and includes actual episode links. You can contact support to request the feed be immediately fetched.

Контент предоставлен BlueDot Impact. Весь контент подкастов, включая эпизоды, графику и описания подкастов, загружается и предоставляется непосредственно компанией BlueDot Impact или ее партнером по платформе подкастов. Если вы считаете, что кто-то использует вашу работу, защищенную авторским правом, без вашего разрешения, вы можете выполнить процедуру, описанную здесь https://ru.player.fm/legal.

Our introduction introduces common mech interp concepts, to prepare you for the rest of this session's resources.

Original text: https://aisafetyfundamentals.com/blog/introduction-to-mechanistic-interpretability/
Author(s): Sarah Hastings-Woodhouse

A podcast by BlueDot Impact.
Learn more on the AI Safety Fundamentals website.

… continue reading

Разделы

1. Introduction to Mechanistic Interpretability (00:00:00)

2. Why might mechanistic interpretability be useful? (00:01:16)

3. Looking inside neural networks (00:03:34)

4. What makes mechanistic interpretability hard? (00:06:33)

5. Addressing polysemanticity (00:08:34)

85 эпизодов

#Tech #Society #Philosophy #Blue Dot Impact

Усі епізоди

×

Добро пожаловать в Player FM!

Player FM сканирует Интернет в поисках высококачественных подкастов, чтобы вы могли наслаждаться ими прямо сейчас. Это лучшее приложение для подкастов, которое работает на Android, iPhone и веб-странице. Зарегистрируйтесь, чтобы синхронизировать подписки на разных устройствах.

Слушайте шоу на 500+ тем

Краткое руководство

Лучшие подкасты

Слушайте это шоу, пока исследуете

Прослушать