Свернуть поиск
Дополнительная колонка
Правая колонка
Например, модель вырабатывает концепцию "обмана" или "честности" без прямых инструкций — просто на основе паттернов текста.
⠀
Больше того, исследователи научились "читать" эти скрытые убеждения, анализируя активации нейронов. Выяснилось, что модель может "знать" истину, но выдавать ложь, и это различие фиксируется на уровне внутренних состояний.
⠀
Машина обретает нечто похожее на разницу между тем, что она думает, и тем, что говорит.

Присоединяйтесь — мы покажем вам много интересного
Присоединяйтесь к ОК, чтобы подписаться на группу и комментировать публикации.
Комментарии 11
Где гарантия, что ложь выдаётся намеренно?