GenRec: Towards LLM-Native Recommendation at Netflix

개요

GenRec는 넷플릭스의 기존 추천 시스템 대비 적은 학습 데이터와 신호만으로도 경쟁하거나 더 나은 성능을 보이는 LLM 기반 추천 랭커입니다.

주요 내용

  • 기존 추천 시스템의 복잡성: 넷플릭스의 기존 추천 시스템은 수천 개의 수작업 특징과 다양한 콘텐츠 유형(영화, 시리즈, 게임, 라이브, 팟캐스트) 및 제품 표면을 지원하기 위한 특화된 아키텍처에 의존하여 복잡성이 높고 새로운 사용 사례 온보딩에 비용이 많이 듭니다.
  • LLM의 가능성과 한계: LLM은 방대한 세계 지식과 언어 이해 능력으로 사용자 기록 및 아이템 메타데이터를 텍스트로 직접 표현하고 자연어 프롬프트를 통해 추천을 제어할 수 있지만, 실제 프로덕션 환경에서는 과도한 추천, 존재하지 않는 아이템 생성, 비즈니스 제약 무시, 제한적인 개인화 등의 한계가 있습니다.
  • GenRec의 아키텍처 및 작동 방식:
  • 사용자 기록, 아이템 메타데이터, 컨텍스트를 텍스트로 변환합니다.
  • 넷플릭스 데이터를 기반으로 파운데이션 LLM을 랭킹에 맞게 추가 학습(post-train)합니다.
  • 넷플릭스 타이틀에 대한 카탈로그 인식(catalog-aware) 스코어링 헤드를 추가합니다.
  • 리워드 신호를 사용하여 장기적인 멤버 가치 및 비즈니스 목표에 부합하도록 조정합니다.
  • 비용 효율성을 위해 넷플릭스의 LLM 서빙 스택에서 prefill-only 모드로 실행됩니다.
  • 데이터 변환 및 컨텍스트 엔지니어링: GenRec는 사용자 기록 및 컨텍스트를 자연어로 변환하며, 토큰 예산 제약을 고려하여 고신호 참여는 유지하고 저신호 이벤트는 생략하거나 요약하는 컨텍스트 엔지니어링을 수행합니다.
  • 다중 목표 학습: GenRec는 추천 랭킹 목표, 언어 모델링 목표, 그리고 리워드 가중 손실(reward-weighted losses)을 결합한 다중 목표 손실 함수를 통해 학습합니다.
  • 오프라인 및 온라인 실험 결과: GenRec는 성숙한 프로덕션 랭커와의 대규모 A/B 테스트에서 단기 및 장기 온라인 지표 모두에서 통계적으로 유의미한 개선을 달성했습니다. 오프라인에서도 적은 학습 데이터와 입력 신호로 프로덕션 랭커를 능가했습니다.
  • LLM 기반 추천으로의 전환: GenRec는 특징 엔지니어링에서 컨텍스트 엔지니어링으로의 전환, 맞춤형 아키텍처에서 파운데이션 백본 활용, 스케일링 법칙 기반 설계, 추천 인프라에서 LLM 인프라로의 통합 등 LLM 네이티브 추천으로의 광범위한 전환을 시사합니다.

시사점

GenRec는 LLM을 활용하여 추천 시스템의 복잡성을 줄이고 효율성을 높이며, 장기적인 사용자 만족도 및 비즈니스 목표 달성에 기여할 수 있는 가능성을 보여줍니다. 이는 넷플릭스뿐만 아니라 대규모 개인화 시스템에서 LLM의 중심적인 역할을 시사합니다.

원문 읽기 →
원문을 불러오는 중...

댓글

GitHub Discussions