ML Team은 Match Group의 다양한 서비스에 AI/ML 기술을 적용하는 ML Engineer로 구성된 팀입니다. 팀의 업무는 실제 제품이 만들어지고 운영되는 과정에서 발생하는 문제를 발굴하고 정의하는 것에서 시작됩니다. 문제 해결에 가장 적합한 SotA(State-of-the-Art) 모델을 만들고, 완성된 모델을 모바일과 서버 환경에 안정적이고 효율적으로 배포합니다. 이후에도 지속적인 모니터링과 개선을 통해 서비스의 AI Flywheel을 구축해 나갑니다. 이 과정에서 백엔드/프론트엔드/DevOps 엔지니어, 데이터 분석가, PM 등 다양한 전문 조직과 긴밀히 협업하며 실제 사용자에게 임팩트를 주는 AI 경험을 만들어갑니다. 일하는 모습에 대한 조금 더 자세한 이야기는 다음의 내용을 참고하시면 좋습니다.
- [How AI Lab Works] Head of AI - Shurain 인터뷰
- AI in Social Discovery(Blending Research and Production)
업무 성과 중 일부는 논문 또는 오픈소스 코드로 외부에 공개하기도 합니다. 제품에 사용하기 위한 목적으로 ML 모델을 만들다 보면, 기존 연구로는 부족한 경우가 많습니다. 부족한 부분을 채우기 위해 진행된 연구의 결과물을 프로젝트 참여자들이 모두 함께 협업하여 연구의 의미 있는 부분을 정돈하고, 가능하다면 코드와 함께 공개합니다. 그 결과, 지금까지 아래 성과를 포함해 약 20여 건의 대외적 연구 성과를 거둘 수 있었습니다.
- 2024년 CUPID: 1:1 소셜 디스커버리 플랫폼을 위한 실시간 세션 기반 상호 추천 시스템 ICDM Workshop 발표
- 2023년 TiDAL: 효율적인 학습 과정의 모델 행동에 기반한 액티브 러닝 기법 ICCV 2023 게재
- 2023년 모더레이션 환경에서 여러 분류 기준을 동시에 만족하기 위한 문턱값을 잡는 연구 WSDM 2023 게재
- 2022년 대화 생성에서의 의미적 다양성을 높이는 연구 EMNLP 2022 게재
- 2022년 레이블 노이즈가 심한 환경에서 효과적으로 학습하는 방법 ECCV 2022 게재
- 2022년 타깃 캐릭터의 몇가지 발화만을 이용하여 타깃 캐릭터를 모방하는 챗봇연구 NAACL 2022 게재
- 2022년 대화 생성 모델에서 예시를 활용하여 성능을 높이는 연구 ACL 2022 Workshop 발표
- 2022년 모바일 환경에서 오디오 분류를 위한 distillation 기술 연구 ICASSP 게재
AI 연구가 잘 진행되기 위해서는 딥러닝 학습을 위한 인프라도 잘 갖추어져야 합니다. ML Engineer들이 충분히 모델을 개발하고 실험할 수 있도록, AWS 기반의 DGX 노드 10대(노드당 H100 GPU 8대, 총 80대 H100)로 구성된 딥러닝 클러스터를 운영하고 있습니다. 또한 데이터 수집·전처리를 포함한 자체 데이터 파이프라인을 클라우드 서비스를 활용해 구축·운영하고 있으며, ML 모델의 제품화를 함께해 주실 다양한 software engineer(백엔드/프론트엔드/DevOps/MLSE)와 협업하고 있습니다.