KAIST와 마이크로소프트연구소 아시아는 예상 결과와 실제 결과의 차이인 보상 예측 오차로 AI가 추정한 목표를, 예상 상태와 실제 상태의 차이인 상태 예측 오차로 행동 방식을 고치는 신경 가치 정렬을 제안했습니다. 뇌파 실험에서 두 신호와 동시 발생을 구분했고 시뮬레이션에서는 목표 변화에 더 빨리 적응했지만, 사람의 생각 전체를 읽거나 실제 로봇에서 효과를 입증한 결과는 아닙니다.
Tech로 돌아가기
Tech
KAIST와 MS가 뇌파로 AI 목표와 행동을 나눠 교정했습니다
목표 오류와 실행 오류를 구분하는 피드백은 유망하지만 실제 로봇 현장 성능은 아직 검증되지 않았습니다.