카카오 AI, 한국어 독해 능력 평가 1위...인간 독해능력 수준 넘었다

카카오가 개발한 AI 언어모델이 LG CNS가 구축한 한국어 학습 데이터(KoQuAD)를 바탕으로한 기계 독해능력 평가에서 1위를 차지했다. 사진은 카카오의 AI스피커 '카카오미니' (사진=카카오)

[글로벌이코노믹 이수연 인턴 기자] 카카오는 자사가 개발한 AI 언어모델이 한국어 학습 데이터 'KorQuAD(The Korean Question Answering Dataset)'를 바탕으로 한 기계 독해 능력 평가에서 91.85점을 받으며 1위를 차지했다고 31일 밝혔다. 이는 평가 주최인 LG CNS가 인간의 문장 판별 및 독해 능력 수준이라고 밝힌 91.20점보다 0.65점 높은 수치로 AI가 인간보다 높은 점수를 기록한 것은 처음이다.

LG CNS가 운영하는 기계 독해 능력 평가는 美 스탠포드 대학에서 시작된 AI 언어지능 연구용 질의응답 학습 데이터셋인 SQuAD(The Stanford Question Answering Dataset)와 동일한 방식으로 구현된다. LG CNS는 지난해 12월 한국어 학습을 위한 데이터인 KorQuAD를 구축해 오픈소스로 공개했으며 누구나 이를 바탕으로 학습한 자체 개발 AI 언어모델을 제출해 성능을 공식 평가 받을 수 있도록 했다.

평가는 데이터셋에서 추출한 내용을 질문으로 제시하고 개발 모델이 이에 대한 답을 찾아내는 방식으로 이루어진다. 예를 들어 “아이유는 1993년 5월 16일 서울특별시에서 태어났으며, 경기도 하남시와 의정부시를 거쳐 서울특별시 광진구에서 자랐다. 초등학교는 하남시의 하남 천현초등학교에서 3학년까지 다니다가 서울 광진구의 서울양남초등학교로 전학해 졸업하였다”와 같은 지문이 주어지고, “아이유가 졸업한 초등학교는 어디인가?”라는 질문에 대해 “서울양남초등학교”라는 정답을 찾아내는 식이다.

카카오의 AI 언어모델(모델명: BERT LM fine-tuned (single) + KHAIII)은 구글의 AI 언어모델 BERT(Bidirectional Encoder Representations from Transformers)에 카카오의 형태소 분석기 'khaiii(Kakao Hangul Analyzer III)’를 접목한 것으로 조사의 사용과 어미의 다양한 변형 등 한국어의 고유 특성에 최적화된 것이다.

카카오는 지난해 말 딥러닝 기술 기반의 형태소 분석기 khaiii를 국내 최초 오픈소스로 제공하는 등 국내 AI 기반 언어지능 연구 발전을 위해서도 노력하고 있다.

김응균 카카오 자연어처리파트 파트장은 “이 평가 결과는 카카오의 인공지능 자연어 처리 기술을 활용해 인간의 독해 능력을 넘어서는 최초의 모델을 구현했다는 점에서 높이 평가받을만 하다”며 “언어모델 기술을 스마트 스피커 카카오미니에 적용하기 위한 연구를 진행 중”이라고 밝혔다.

이수연 기자 swoon77@g-enews.com

Search

ICT

카카오 AI, 한국어 독해 능력 평가 1위...인간 독해능력 수준 넘었다

한국어 특성 최적화한 자체 개발 AI 언어모델로 최고점...향후 카카오미니에 적용
LG CNS가 구축한 한국어 학습 데이터 바탕 기계 독해능력 평가에서 0.65점 앞서

[관련기사]

헤드라인 뉴스

글로벌비즈

G-Ship Story

G-Military

세계 속 한류

오늘의 주요뉴스

투데이 컴퍼니

많이 본 기사

글로벌 슈퍼리치

리얼시승기

ICT 실시간 뉴스

글로벌이코노믹 패밀리 사이트

Search

ICT

카카오 AI, 한국어 독해 능력 평가 1위...인간 독해능력 수준 넘었다

한국어 특성 최적화한 자체 개발 AI 언어모델로 최고점...향후 카카오미니에 적용 LG CNS가 구축한 한국어 학습 데이터 바탕 기계 독해능력 평가에서 0.65점 앞서

[관련기사]

헤드라인 뉴스

글로벌비즈

G-Ship Story

G-Military

세계 속 한류

오늘의 주요뉴스

투데이 컴퍼니

많이 본 기사

글로벌 슈퍼리치

리얼시승기

ICT 실시간 뉴스

글로벌이코노믹 패밀리 사이트

한국어 특성 최적화한 자체 개발 AI 언어모델로 최고점...향후 카카오미니에 적용
LG CNS가 구축한 한국어 학습 데이터 바탕 기계 독해능력 평가에서 0.65점 앞서