577 읽음
글 안 쓰는 AI 제브, 판단 전용으로 비용 절감
IT조선
2
9월 15일, 글을 한 줄도 쓰지 못하는 AI가 나왔다. 질문을 던지면 돌아오는 것은 문장 대신 숫자 몇 개다. 그런데 출시 닷새 만에 개발자 커뮤니티가 달아올랐다. 개발자 커뮤니티 해커뉴스에서는 하루 만에 추천 1500점과 댓글 400여 개가 붙었다.

미국 스타트업 타입세이프(TypeSafe) AI가 공개한 ‘Jev’ 이야기다. 챗봇이 얼마나 말을 유려하게 잘하는지 겨루는 경쟁의 한복판에서, 말을 버린 모델이 왜 이런 반응을 이끌어내고 있는지 분석해 본다.

Jev는 무엇인가

창업자 디오고 알메이다는 오픈AI에서 챗GPT의 토대가 된 학습 기법(RLHF)을 공동 개발했다. AI를 ‘사람과 대화하는 존재’로 만든 주역이 2년의 비공개 개발과 4000만 달러 투자를 거쳐 ‘사람과 대화하지 않는 AI’를 들고 나온 것이다. 기존 AI가 사람의 언어에 지나치게 맞춰져 있어 자동화에는 한계가 있다는 것이 그의 진단이다. 그는 Jev가 동료보다 데이터베이스에 가깝다고 말한다.

쓰는 법은 직관적이면서 단순하다. 판단할 상황과 질문을 넣으면 세 가지 형태의 답만 돌려준다. 어떤 말이 참일 확률(Noul), 보기 중 하나의 선택(Choice), 등급에 따른 평가 (Score)다. 타입세이프는 이를 ‘시스템 원 모델’이라 부른다. 심리학자 카너먼이 말한 빠른 직관(시스템 1)에서 따온 이름이다. 깊은 숙고는 기존 LLM에 맡기고, 짧고 반복적인 판단만 떼어 낸 모델이다.

고객이 "환불은 필요 없고, 지난달 결제 내역만 확인하고 싶습니다"라고 썼다고 하자. 키워드 규칙은 '환불'이라는 단어때문에 엉뚱하게 흘러간다. 반면, jev는 부정 표현까지 읽고 '결제 내역 조회, 97%' 같은 값을 돌려준다.

사과문도 안내문도 쓰지 않는다. 프로그램은 그 값을 받아 곧바로 조회 기능으로 넘어간다. 프로그램에는 '만약 ~이면 ~하라'는 갈림길, 이른바 if문이 무수히 박혀 있다. 지금까지 그 조건은 '주문 금액이 10만 원 이상인가'처럼 계산되는 것이어야 했다. 이제 '이 고객이 화가 났는가'도 조건이 된다. 한 해외 개발자가 Jev를 똑똑한 if문에 빗댄 이유다.
왜 빠르고 싼가: 서술형과 OMR의 차이

LLM은 답을 쓸 때 앞 글자를 보고 다음 글자를 고르는 일을 되풀이한다. AI가 글을 읽고 쓰는 단위이자 요금의 단위가 토큰인데, 답이 '결제팀' 한 단어여도 프로그램이 읽을 형식을 갖추려면 수십 토큰을 차례로 써야 한다.

객관식 문제에 서술형 답안을 쓰게 하는 격이다. Jev는 글쓰기를 건너뛰고 보기별 확률을 한 번에 계산해 내놓는다. OMR 카드에 마킹만 하는 셈이다. 같은 지문에 질문 여러 개를 동시에 물을 수도 있다. 회사가 밝힌 응답 시간은 0.07~0.5초, 가격은 입력 100만 토큰당 0.042달러다. 돌려주는 것이 글 대신 값 몇 개뿐이니 출력은 무료다. 호출당 1500토큰씩 100만 번을 불러도 63달러다. 다만 내부 구조는 공개되지 않았다.

왜 지금 반응이 폭발적인가

데모부터 직관적이었다. 탁구 게임 '퐁'에서 주요 챗봇 모델들이 12초 동안 두세 번 판단하는 사이 Jev는 47번 판단했고, 슈팅 게임 '둠'에서는 초당 10회의 판단을 시간당 7달러 수준으로 돌렸다. 출시 며칠 만에 랭체인과 버셀이 연동을 내놓았고 보드게임 AI, 동적 설문, 검색 평가기 같은 실험작이 쏟아졌다.

더 본질적인 이유는 Jev가 에이전트 시대의 병목에 대한 방향성을 제시했다는 데 있다고 본다. 스스로 계획하고 도구를 쓰며 일을 끝내는 AI가 에이전트다. 에이전트는 한 번 답하고 끝나지 않는다. 요청을 해석하고, 도구를 고르고, 결과를 평가하고, 다음 행동을 정하는 고리(루프)를 계속 돈다. 그 고리마다 '이 문의는 어느 부서 소관인가', '이 결과를 통과시켜도 되는가' 같은 자잘한 판단이 박혀 있다.

지금까지는 그때마다 가장 비싼 범용 모델을 불러 문장을 쓰게 했다. 필요한 것은 부서 이름 하나인데 청구서에는 문장을 만든 비용이 찍힌다. 루프가 돌 때마다 보이지 않는 미터기가 올라가는 구조, 사용자도 모르게 가치도 없는 토큰에 과금되는 구조가 여기에 있었다. 루프 설계가 곧 원가 설계인 시대에, Jev는 사람이 읽지도 않는 중간 판단용 토큰이라는 가장 아까운 낭비를 겨냥했다.

이름도 그 계산에서 나왔다. Jev는 경제학자 제번스에서 가져왔다. 효율이 좋아져 값이 싸지면 소비는 오히려 늘어난다는 '제번스의 역설'의 그 제번스다. 판단 한 번의 값이 0에 가까워지면 아껴 쓸 이유가 사라진다.

버튼 하나, 문서 한 줄, 에이전트의 행동 하나마다 검사를 붙일 수 있다. 고객 문의 분류, 웹 에이전트의 버튼 선택, 게임 캐릭터의 전술, 명령 실행 직전의 안전 검사, 어느 모델에 일을 맡길지 고르는 라우팅까지 '보기가 정해진 판단'이면 어디든 들어간다.

LLM으로 에이전트를 감사하면 비용이 커지지만 Jev로는 싸게 할 수 있다는 현업 개발자의 평가도 나왔다. 에이전트의 일탈을 실시간으로 잡아내는 감시자 계층이 경제성을 얻는 것이다.

무엇이 해결되고, 무엇이 남는가

해결되는 것은 크게 세 가지다.

첫째는 반복 판단의 속도와 비용, 둘째는 형식의 안정성이다. Jev는 미리 정한 보기 밖의 답을 낼 수 없어, 없는 부서를 지어내는 식의 환각이 구조적으로 막힌다. 셋째, 불확실성을 숫자로 돌려준다는 점이다. 타입세이프는 모델이 90%라고 답한 사례를 모으면 실제로도 90%쯤 맞도록 확률을 맞추는 학습법(RLCD)을 내세운다.

이게 되면 "확신이 높으면 자동 처리, 애매하면 사람에게"라는 분기를 짤 수 있다. 물론, 그건 그냥 모델이 정해주지는 않는다. 오처리 한 건의 손실이 100이고 사람 검토 비용이 2라면 정답 확률이 98%를 넘을 때만 자동 처리가 이득인 것이다. 결국 조직이 정하는 거버넌스에 대한 정책이 중요하다.

여전히 남아 있는 문제도 있다. jev가 말하는 '환각 제로'는 형식에 관한 이야기다. 기술 문의를 결제 문의로 잘못 고르는 오판은 여전히 가능하고, 형식이 멀쩡한 오답은 그대로 실행 경로로 들어갈 수 있다. 출력 방식은 잡아도 판단 자체는 잡지 못한다는 지적에 알메이다도 높은 확신으로 틀릴 수 있음을 인정했다.

완전히 새로운 기술인가도 따져봐야 하는 부분이다. 요즘 LLM도 출력 형식을 강제하는 기능을 제공하고, 보기를 그때그때 주고 고르게 하는 제로샷 분류기도 오래된 기술이다. 해커뉴스에서 결국 제로샷 분류기 아니냐는 물음이 나오자 창업자는 바로 그렇다고 답했다. 차별점은 하나의 모델에 질문과 기준만 바꿔 넣어 오늘은 민원 분류에, 내일은 코드 검사에 쓰는 범용성을 이 속도와 가격에 내놓았다는 데서 찾아야 한다.

0.07초 대 329초 같은 비교도 LLM이 긴 사고 과정을 통째로 써 내려간 경우라면 같은 조건의 비교가 못 된다는 반론도 있고, 회사 스스로 공개한 약점도 있다. 숫자, 날짜 계산, 여러 단계의 추론, 잡음 많은 긴 입력, 판단을 유도하는 악의적 문구에 약하고 학습의 중심이 영어라는 지점이다.

앞으로 어떻게 전개될까

첫째, 무게중심이 모델에서 시스템으로 더 옮겨 간다. 글·코드·계획 같은 열린 결과물은 생성형 모델이, 좁고 반복적인 판단은 Jev류 모델이, 계산·권한·실행은 코드가 맡는 분업이다. '생성하고 실행한다'에서 '판단하고, 분기하고, 실행한다'로의 이동이다.

분업이 공짜는 아니다. 판단 하나가 99% 정확해도 스무 개가 연달아 맞아야 하는 업무라면 단순 계산으로 성공률은 82%까지 떨어진다. 어느 사실을 따로 확인하고 틀린 행동을 어떻게 되돌릴지 설계하는 역량, 곧 하네스 엔지니어링이 모델 성능만큼 중요해진다. 기준은 성공한 작업당 비용이다.

둘째, 토큰 이코노미가 흔들린다. 빅테크의 천문학적 투자는 에이전트 확산에 따른 토큰 폭증으로 회수된다는 계산 위에 서 있다. 그 토큰 가운데 중간 판단 몫이 수십, 수백분의 1 값으로 대체되면 회수 곡선의 일부가 꺾인다. 대형 랩들도 판단 전용 모델로 맞설 공산이 크다. 다만 제번스의 역설은 양쪽으로 작동한다. 검사가 촘촘해져 믿을 만해진 에이전트는 더 많은 업무에 투입되고, 생성 토큰 수요도 함께 커진다. 토큰 사용량이 수요의 증거라면, 이제는 그중 얼마가 제값을 하는 토큰인지 검증해야 할 차례다.

셋째, 검증의 시간이 온다. 수치는 모두 회사 발표이고, 데모는 시뮬레이터 위에서 이뤄졌으며, 아키텍처 논문도 독립 벤치마크도 없다. 회사가 공개 리더보드 대신 자체 업무 평가를 택한 만큼 제3자 검증이 이뤄질 것이다. 공개 평가의 기준 답안도 GPT-6 아스트라와 클로드 페이블 5.1이 낸 답을 모은 것이어서 현실의 정답과는 구분해야 한다.

한 외부 분석은 이 평가에서 Jev의 정확도를 약 68%, 중급 LLM 수준으로 읽었다. 업무가 안정적이고 데이터가 충분하면 기존 전용 분류기가 나을 수도 있다. 결국, 같은 오류 허용 수준에서 더 많은 일을 자동 처리하고, 사람의 개입과 잘못된 처리에 대한 수습까지 포함한 총 비용을 줄일 수 있는지가 결국 중요해질 것이다.

뉴로심볼릭 AI가 중요한 이유

AI의 역사는 두 진영의 경쟁이었다. 사람이 규칙과 지식을 기호로 적어 넣는 기호주의, 데이터에서 패턴을 배우는 연결주의(신경망)이다. 규칙은 정확하고 설명 가능하지만 말의 변화무쌍함 앞에서 부서졌고, 연결주의는 유연하지만 왜 그런 답을 냈는지 보증하지 못했다.

LLM의 시대는 연결주의의 압승처럼 보였다. 그러나 의료·금융·공공처럼 오류가 허용되지 않는 영역에서 생성형 AI는 환각, 그리고 인과와 근거의 부재라는 벽에 부딪혔고, 단순히 모델을 키우는 것만으로는 이 벽이 조금 낮아지긴 했지만, 근본적으로 해결되지는 않았다.

이 둘을 결합하는 뉴로심볼릭(neuro-symbolic) AI가 관심을 받는 이유다. 구글 딥마인드의 알파지오 메트리가 신경망의 직관과 기호 추론 엔진을 결합해 국제수학올림피아드 기하 문제를 금메달리스트에 근접한 수준으로 풀어낸 것이 대표적 성과다.

핵심은 역할을 섞지 않는 것이다. "환불해 달라"는 의도와 "환불받을 자격이 있다"는 판단은 다르다. 앞의 것은 언어의 문제이고 뒤의 것은 거래 기록과 약관의 문제다. 의도는 Jev 같은 모델이 추정하고, 중복 결제 여부는 데이터베이스가 확인하고, 금액·기한·승인 권한은 규칙이 검사하고, 실행은 제한된 통로로만 하고, 안내문은 생성형 모델이 쓸수 있을 것이다.

Jev는 이 구조에서 연결주의 쪽의 구성요소, 즉 비정형의 말을 규칙이 다룰 수 있는 조건값으로 바꿔 주는 연결부라고 봐야 한다. 여기서 지켜야 하는 중요한 원칙은 모델의 추정치를 사실로 그대로 승격시키지 말아야 한다는 것이다. 결정론적인 실행이 확률적인 전제를 사실로 바꿔 주지는 않는다. 규칙도 만능은 아니어서, 처음부터 잘못 쓰였거나 전제가 거짓이면 일관되게 틀릴 수 밖에 없다.

여전히 사람이 개입해야할 지점도 있다. 의료 기록에서 '복약을 중단했다', '중단하지 않았다', '언급이 없다'는 서로 다른 상태다. 예/아니오 하나로 뭉개버리면 정보 부족이 그냥 부정적 대답으로 흘러갈 수 있다. 표현마다 규칙을 일일히 짜야 하던 노가다는 줄어도, 업무의 뜻을 정의하고 경계 사례를 정하는 노동은 여전히 중요하다.

그래도, 이 구조에서 중요한 것은 감사 가능성이다. 즉, 설명 가능성이다. 어떤 입력에 어떤 확률이 나와 어느 경로를 탔는지가 기록으로 남는다. 민원 분류는 모델이, 적용 법령·처리 기한·권한은 규칙이 맡고 전 과정이 로그로 남는 행정·공공 AX가 가야 할 그림도 그려진다.

한국의 숙제

Jev 와 같은 모델이 한국에 도입될때 어떤 부분들을 고민해야 할까. 먼저, 한국어 판단 평가 데이터다. "취소까지는 생각 없는데요"와 "이러면 취소해야겠는데요"를 가르는 것은 생략과 완곡, 어미의 뉘앙스다. 영어 중심 모델이 이 경계를 어떻게 이해하는지 한국어로 측정 해봐야 안다.

둘째, 국산 모델 전략의 시야를 넓혀야 한다. 거대 범용 모델의 최고점 경쟁 바깥에, 한국어 민원·금융·의료의 판단에 특화한 작고 빠른 모델이라는 해볼 만한 영역이 열렸다. 에이전트 시대의 토큰 최적화는 발전소 한 곳과 맞먹는 과제이고, 토큰 순수입국인 한국에는 토큰을 덜 쓰는 기술이 곧 수지 개선이다.

셋째, 공공 조달이 표준을 끌어야 한다. 판단·규칙·실행의 분리·확률과 경로의 기록을 요구사항에 넣으면 시장도 따라올 수 있다. 물론, 공공이 이렇게 빨리 움직일 수 있을지는 미지수다.

알메이다는 지능의 대부분이 결국 소프트웨어 안에서 조용히 돌아가게 될 것이라고 말했다. 에이전트 시대에, AI가 얼마나 말을 잘하는지를 겨루던 시대에서, AI의 판단을 얼마나 싸고 빠르고 검증 가능하게 쓸 수 있는지를 겨루는 시대로 넘어가고 있는 점은 중요하다. 말하지 않는 AI의 등장은 그 자체로도 상징적이다.

※ 외부필자의 원고는 IT조선의 편집방향과 일치하지 않을 수 있습니다.

이승현 라이너 AI 에반젤리스트는 스타트업 창업가 출신의 AI 전문가다. 디지털플랫폼정부위원회 인공지능플랫폼혁신국장으로서 재직하면서 대한민국 공공 AI의 초석을 닦았으며, 현재는 한양대 에리카 글로벌문화통상학부 겸임교수, 가천대 스타트업칼리지 겸임교수, 법무법인 린의 공공AX 고문을 겸하며 기술과 정책의 가교 역할을 하고 있다. 이론에 머물지 않는 현장형 전략가로서 국가 전반의 AI 네이티브 전환을 이끌고 있다.
0 / 300