문서

AI 프라이머

TypeSafe가 생성된 텍스트에 최적화하는 대신, 왜 캘리브레이션된 확률을 가진 결정 모델을 훈련하는지 설명합니다.

대부분의 AI 제품은 모델과 사람 사이의 대화를 중심으로 만들어집니다. TypeSafe는 다른 베팅에서 출발합니다. 대규모 자동화는 AI 대 AI, 그리고 AI 대 소프트웨어 상호작용이 지배할 것이므로, 채팅 인터페이스보다 기계 인터페이스가 더 중요하다는 것입니다.

저희는 이것을 머신 네이티브 인텔리전스(Machine Native Intelligence)라고 부릅니다:

구조, 신뢰성, 관찰 가능성, 테스트 가능성, 속도, 일관성, 낮은 비용 같은 소프트웨어적 속성을 지닌 AI입니다.

prod를 만드는 것이지, 신을 만드는 것이 아닙니다

TypeSafe는 모든 것을 다 하는 모델을 만들려 하지 않습니다. 그것은 검사하고 행동할 수 있는 좁은 결정이 코드에 필요한 프로덕션 시스템을 위해 설계되었습니다.

저희의 예상은 대규모 AI 자동화가 대략 99%의 기계 대 기계 상호작용과 1%의 사람 상호작용에 가까워질 것이라는 점입니다. 이는 설계 목표를 읽기 좋은 응답에서, 소프트웨어 안에서 예측 가능하게 동작하는 출력으로 옮깁니다.

TypeSafe 매니페스토를 참조하십시오.

세 가지 사후 훈련 접근법

사전 훈련된 언어 모델은 크게 두 방식으로 적응되어 왔습니다. TypeSafe는 세 번째를 더합니다. RLHF와 RLVR은 여기서 배경으로 보여 주며, TypeSafe의 훈련 경로는 RLCD입니다.

RLHF

인간 피드백을 통한 강화 학습은 사전 훈련된 모델을 챗봇으로 바꿨습니다. 사람이 선호하는 응답을 내도록 모델을 훈련합니다.

RLVR

검증 가능한 보상이 있는 강화 학습은 수학 같은 과제에 강하지만 더 느리고 더 비싼 추론 모델을 만들었습니다.

RLCD

캘리브레이션된 결정을 위한 강화 학습은 생성된 텍스트 대신 결정과 캘리브레이션된 확률을 반환하도록 TypeSafe를 훈련합니다.

RLHF는 InstructGPT와 ChatGPT를 훈련하는 데 쓰였으며, TypeSafe의 공동 창업자인 Diogo Almeida가 공동 고안했습니다.

사전 훈련된 언어 모델이 흐릿한 RLHF 경로와 RLVR 경로, 그리고 강조된 RLCD 결정 모델 경로로 갈라지는 모습.

RLCD와 캘리브레이션된 결정

RLCD는 다른 출력 계약을 최적화합니다.

  • 모델은 텍스트를 생성하지 않습니다.
  • 결정과 확률을 반환합니다.
  • 더 높은 확률은 답이 정답일 가능성이 더 큼에 대응해야 합니다.

캘리브레이션은 불확실성을 소프트웨어가 쓸 수 있게 만듭니다. 잘 캘리브레이션된 모델의 많은 예측 전체에서:

  • 확률 0.2가 부여된 결과는 약 20%의 경우에 일어나야 합니다.
  • 확률 0.8이 부여된 결과는 약 80%의 경우에 일어나야 합니다.
  • 확률 1.0이 부여된 결과는 100%의 경우에 일어나야 합니다.

이 비율은 예측의 집단을 설명하는 것이지, 어느 단일 답에 대한 보장이 아닙니다. 소프트웨어가 언제 행동하고 언제 에스컬레이션할지 결정하는 지침은 신뢰도를 참조하십시오.

RLHF의 문제점

RLHF는 사람이 선호하는 말을 하도록 모델을 가르칩니다. 그 목표는 챗봇에는 잘 맞지만, 아첨과 확신에 찬 환각을 보상할 수도 있습니다.

선호 최적화는 또한 모드 드롭(mode dropping)을 일으킵니다. 모델은 지시 따르기 같은 특정 스타일을 선호하도록 학습하고, 다른 가능한 출력의 확률은 낮춥니다.

기본 모델의 확률 분포를, RLHF 이후 좁아지고 모드 드롭된 분포와 비교한 모습.

모드 드롭은 모드 붕괴(mode collapse)의 완화된 버전입니다. 고전적인 생성적 적대 신경망의 실패 모드에서는, 생성기가 판별자를 계속 속이는 출력이기에 같은 종류의 출력을 반복해서 만들어 내도록 학습합니다.

모드 붕괴 비유
반복되는 문자로 모드 붕괴에 빠진 GAN을 나타낸 모습.

RLHF는 대화형 모델에는 여전히 잘 맞습니다. TypeSafe의 입장은 프로덕션 자동화에는 다른 훈련 목표가 필요하다는 것입니다. 제약된 결정과 캘리브레이션된 불확실성을 중심에 둔 목표입니다.