mt logoMyToken
ETH Gas
EN

Anthropic의 AI 기반 쿼리 학습: 일반적인 사례 연구를 제공하지 않으면 오탐률이 97%까지 치솟습니다.

2026-08-27 10:49:16
Shareshare

Beating AI News에 따르면 , Anthropic 연구진은 다른 AI를 조사하도록 특별히 설계된 에이전트를 훈련시키려 했습니다. 먼저, 편향, 기만, 허위 인용과 같은 숨겨진 행동들을 대상 모델에 몰래 심어 넣은 다음, Haiku 4.5가 스스로 조사하도록 했습니다. Haiku는 정답을 알지 못했고, 질문과 시나리오를 변경하고 최대 15회까지 반복적으로 테스트만 수행할 수 있었습니다.


훈련 과정에서 연구원들은 하이쿠에게 정답 여부를 직접 알려주지 않습니다. 하이쿠는 설문조사를 완료할 때마다 이전 버전의 하이쿠가 남긴 설문조사 기록과 비교합니다. 그러면 정답을 미리 알고 있는 소넷 4가 어떤 설문조사가 더 나은지 판단합니다. 이전 설문조사 기록은 50번의 훈련 단계마다 업데이트되므로, 하이쿠는 끊임없이 과거 성능을 검증할 수 있습니다.


하지만 훈련 과제가 모두 결함 있는 모델로만 구성될 경우, Haiku는 빠르게 잘못된 학습을 하게 됩니다. 보상을 얻기 위해 초기에는 모든 모델이 결함이 있다고 가정했는데, 이로 인해 정상 모델을 접했을 때 오탐률이 97%에 육박하는 경우도 있었습니다. 이후 연구진은 훈련 과제의 절반을 완전히 정상 모델로 대체했고, 검증 후 목표 모델이 결함이 없음을 정확하게 판단한 경우에만 높은 보상을 부여했습니다.


훈련 후 Haiku는 실제로 다른 감사 방식을 사용하기 시작했습니다. 모델이 오류를 즉시 인정하도록 강요하는 대신, 시나리오를 사전에 변경하고 변수를 제어하며 이전과 이후 답변을 비교합니다. 최종 감사 점수는 44.2에서 48.7로 향상되어 Opus 4.6의 48.4와 거의 동일한 수준이 되었습니다. 이상 행동을 적극적으로 숨기는 더욱 까다로운 AuditBench로 전환했을 때, 탐지율 또한 11.5%에서 최고 28.1%까지 증가했습니다.

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup