1. Introduction최근 LLM은 높은 언어 이해 및 생성 능력을 바탕으로 다양한 분야에서 활용되고 있다. 하지만 사전학습만으로는 모델이 항상 사용자의 의도나 선호에 맞는 답변을 생성하기 어렵다. 이를 보완하기 위한 대표적인 방법이 사람의 피드백을 학습에 반영하는 RLHF(Reinforcement Learning from Human Feedback)이다.RLHF는 일반적인 LLM 학습과 비교했을 때 시스템 구성이 복잡하다. 하나의 모델만 학습하는 것이 아니라, 여러 모델이 서로 다른 역할을 수행하면서 하나의 학습 과정을 구성하기 때문이다.대표적인 PPO 기반 RLHF에서는 다음 네 종류의 모델을 사용한다.Actor: Prompt에 대한 response를 생성하고, 높은 reward를 받도록 학습되..
논문 리뷰
학회와 저널이란?1. 학회(Conference)학회는 연구자들이 특정 기간(예: 연 1~2회) 동안 모여 연구 결과를 발표하고 토론하는 행사다 학회에서는 논문 발표 외에도 워크숍, 튜토리얼, 패널 토론 등이 포함된다 학회에서 발표된 논문은 Conference Proceedings에 수록되며, 보통 빠르게 연구 결과를 공유하는 목적을 가진다.2. 저널(Journal)저널은 정기적으로 발행되는 학술지로, 연구자가 논문을 제출하면 동료 심사(Peer Review)를 거쳐 게재 여부가 결정된다 논문 심사 과정이 길지만(수개월~1년), 학술적으로 높은 신뢰도를 갖는다.학회와 저널의 차이 구분 학회저널심사 과정비교적 빠름(주~몇 달)오래 걸림(수개월~1년 이상)연구 내용최신 연구 트렌드 반영검증된 심층 연구발표 방..