520 읽음
가설 생성부터 실험까지, AI 과학 연구 자동화
스타트업엔
0
인공지능(AI)의 역할이 논문 검색과 요약, 코드 작성에서 실제 과학 연구 과정으로 확대되고 있다. 연구자가 던진 질문에 답하는 수준을 넘어 가설을 만들고, 실험을 설계하고, 결과를 분석한 뒤 다음 실험을 결정하는 연구 자동화가 새로운 AI 기술 영역으로 떠오르고 있다.

특히 생명과학과 신약개발, 첨단소재 분야에서는 AI 모델과 자율 실험실을 결합해 실제 데이터를 확보하고 이를 다시 AI 학습에 활용하는 방식이 등장하고 있다. AI가 과학적 추론과 실험을 반복하는 ‘폐쇄루프’ 연구가 현실의 연구개발 과정에 들어가기 시작한 셈이다.

다만 현재 공개된 성과 상당수가 기업 자체 평가나 내부 데이터에 기반하고 있다는 점은 살펴볼 필요가 있다. AI가 연구자의 판단을 완전히 대체했다고 보기보다, 과학 연구의 일부 과정을 자동화하고 탐색 범위를 넓히는 단계로 보는 시각이 필요하다.

최근 AI의 과학적 추론 능력을 보여주는 사례도 잇따르고 있다.

오픈AI는 약 1만개의 AI 에이전트를 동시에 운용해 밀레니엄 난제 가운데 하나인 나비에-스토크스 문제를 탐색했다. 오픈AI에 따르면 문제 해결에 참여한 에이전트들은 약 88시간 동안 여러 접근법을 병렬로 탐색했고, 이후 GPT-6 Astra를 이용한 형식화와 검증에 17시간이 추가로 소요됐다.

다만 해당 결과는 제안된 해법에 대한 외부 수학계의 검증과 별개로 봐야 한다. AI가 제시한 결과가 곧바로 수학계에서 완성된 정리로 인정되는 것은 아니기 때문이다.

앤트로픽은 클로드를 활용해 페르마의 마지막 정리를 컴퓨터가 검증할 수 있는 형태로 형식화했다고 밝혔다. 11일 동안 AI 에이전트들이 작업하면서 29500개의 중간 정리를 증명했고, 최종 결과물은 1300만 줄의 Lean 코드로 구성됐다. 앤트로픽은 Lean을 통해 완성된 증명을 컴퓨터로 검증했다고 설명했다.

수학 분야에서 나타난 변화는 AI의 역할이 단순한 답변 생성에서 여러 추론 경로를 탐색하고 결과를 검증하는 연구 시스템으로 확대되고 있음을 보여준다.

문제는 실험과학이다. 생명과학이나 소재 연구에서는 정답을 논리적으로 증명하는 것만으로 연구가 끝나지 않는다. 어떤 가설을 세울지 결정하고 실제 실험을 수행한 뒤 예상과 다른 결과가 나오면 다시 가설을 수정해야 한다.

국내에서는 아스테로모프가 범용 AI 모델과 실제 과학 연구 사이를 연결하는 ‘추론 레이어’ 기술을 개발하고 있다.

추론 레이어는 대규모언어모델(LLM)에 과학 분야별 데이터와 전문 도구, 여러 AI 에이전트의 협업 및 검증 과정을 결합하는 방식이다. 핵심은 한 번의 답변을 내놓는 데 그치지 않고 여러 차례 추론과 검증을 거치면서 가설을 발전시키는 구조다.

아스테로모프가 개발한 ‘틸라(Thyla) 1.0’은 이 구조를 검증하기 위한 개념증명(PoC) 시스템이다. 특정 AI 모델에 종속되지 않는 모델 애그노스틱 구조를 기반으로 여러 AI 에이전트와 과학 데이터, 전문 도구를 문제에 따라 조합한다.

회사 자체 평가에서는 주요 백본 모델로 사용한 GLM-5.1이 ‘Frontier Science-Research’에서 10.0%를 기록한 반면 추론 레이어를 적용한 틸라 1.0은 33.9%를 기록했다. 해당 수치는 아스테로모프가 공개한 자체 평가 결과다.

실제 물리 문제 풀이에서도 성과를 공개했다. 아스테로모프의 AI 시스템은 지난 7월 콜롬비아에서 열린 제56회 국제물리올림피아드(IPhO 2026) 이론시험에 인간 참가자와 같은 5시간 동안 참여해 30점 만점에 28.6점을 받았다. 인터넷과 외부 AI 모델을 사용할 수 없는 환경에서 시험지를 입력받아 풀이와 검증, 답안 작성까지 수행했으며, 국제물리올림피아드 측은 금메달 성적에 해당하는 공식 결과를 인정했다.

이 성과가 보여주는 지점은 단순히 특정 AI 모델의 성능만은 아니다. 아스테로모프는 여러 추론 경로를 만들고 결과를 검토하는 시스템 설계 자체가 과학 문제 해결 능력에 영향을 줄 수 있다고 보고 있다.

미국 라일라 사이언스는 AI와 로봇 기반 자율 실험실을 결합한 ‘AI Science Factory’를 구축하고 있다.

연구 과정은 가설 생성, 실험 설계, 자동화 실험, 결과 분석, 다음 실험으로 이어지는 폐쇄루프 형태다. 실험실에서 확보한 결과를 다시 AI의 연구 과정에 투입해 다음 실험을 결정하는 방식이다.

라일라 사이언스는 최근 95만개 이상의 mRNA 서열을 설계하고 합성한 뒤 살아있는 세포에서 발현 특성을 측정했다고 밝혔다. 연구 과정에서 장기간 단백질 발현이 유지되는 mRNA 후보를 확인했고, 이후 체내 CAR-T 연구로 영역을 넓혔다. 비인간 영장류를 대상으로 한 실험에서는 회사가 설정한 비교군보다 깊고 지속적인 B세포 제거 효과를 확인했다고 설명했다.

다만 이 결과는 회사가 공개한 연구 성과라는 점에서 실제 치료제 개발과 임상적 유효성까지 동일하게 볼 수는 없다. AI 기반 신약개발이 상용화로 이어지기 위해서는 추가적인 전임상 및 임상 검증이 필요하다.

첨단소재 분야에서도 AI와 자율 실험실을 결합한 연구가 진행되고 있다.

피리오딕 랩스는 초전도체와 자성 소재 탐색을 위해 고처리량 실험실을 구축하고 실험 결과를 AI가 분석해 다음 연구 과정에 반영하는 구조를 개발하고 있다.

9월에는 자체 실험실 데이터를 학습한 AI 모델 ‘Periodic Neon’을 공개했다. 피리오딕 랩스에 따르면 Neon은 X선 회절(XRD) 데이터를 분석해 실험 과정에서 생성된 물질을 판별하는 데 특화됐다.

회사 내부 평가셋인 ‘FrontierXRD’에서는 55.3%의 성공률을 기록했다. 평가 대상은 실험실에서 확보한 134개 샘플이며, 피리오딕 랩스는 Neon이 GPT-6 Astra와 Claude Fable 5.1보다 낮은 비용으로 해당 평가에서 높은 성능을 보였다고 밝혔다.

다만 FrontierXRD는 피리오딕 랩스가 자체 구성한 평가 환경이다. 현재 공개된 성과만으로 새로운 소재를 실제로 발견하는 능력까지 입증됐다고 판단하기는 어렵다. 현재 확인되는 핵심 성과는 실험 이후 생성된 XRD 데이터를 분석하는 단계에 가깝다. 향후 소재 가설을 만들고 합성 방법을 설계한 뒤 다음 실험까지 자율적으로 선택하는 수준으로 확대할 수 있을지가 주요 과제가 될 전망이다.

구글 출신 AI 연구자 제프 딘, 산제이 게마왓, 쿽 레, 오리올 비냘스가 공동 설립한 디스커버리 루프도 과학 연구 자동화를 목표로 하고 있다.

디스커버리 루프는 머신러닝 연구와 엔지니어링을 시작점으로 삼아 AI가 실험을 제안하고 실행하며 결과를 분석한 뒤 다음 실험으로 이어가는 연구 자동화 시스템을 구축한다는 구상이다. 수천개의 실험을 병렬로 수행하면서 연구자가 반복적으로 진행해 온 실험과 분석 과정을 자동화하는 것이 핵심이다.

향후에는 의약품 개발, 의료정보학, 소재과학, 태양에너지, 청정수, 사이버보안 등으로 적용 범위를 넓힌다는 계획이다. 투자사인 래디컬벤처스도 디스커버리 루프가 머신러닝 연구 자동화에서 시작해 의학, 소재과학, 청정에너지 등으로 영역을 확대할 계획이라고 밝혔다.

Scientific AI의 경쟁은 결국 AI 모델의 파라미터 규모만으로 결정되기 어려울 가능성이 크다.

과학 연구에서는 좋은 답을 생성하는 것과 실제로 새로운 지식을 발견하는 것 사이에 상당한 차이가 있다. 가설의 독창성뿐 아니라 실험 설계의 적절성, 데이터의 신뢰성, 재현성, 외부 검증까지 통과해야 연구 성과로 인정받을 수 있기 때문이다.

현재 등장한 Scientific AI 시스템들은 이 과정의 일부를 자동화하는 단계에 있다. 아스테로모프는 AI 에이전트와 추론 구조를 통해 과학적 문제 해결 능력을 높이는 데 초점을 맞추고 있고, 라일라 사이언스는 생명과학 실험을 AI와 연결했다. 피리오딕 랩스는 소재 실험 데이터와 AI 모델의 결합을 시도하고 있으며, 디스커버리 루프는 연구 과정 전체의 자동화를 목표로 삼고 있다.

결국 경쟁의 핵심은 ‘AI가 과학 문제를 풀 수 있는가’에서 ‘AI가 가설을 세우고 실제 실험으로 검증하며 실패한 결과를 다음 연구에 반영할 수 있는가’로 이동하고 있다. 동시에 기업 자체 평가에 머무르지 않는 독립적인 검증과 재현 가능한 실험 데이터 확보가 Scientific AI가 넘어야 할 다음 단계로 꼽힌다.

아스테로모프 관계자는 “향후 과학 AI의 경쟁력은 단순히 벤치마크에서 높은 점수를 내는 것을 넘어 실제 연구 현장에서 의미 있는 가설을 제시하고 실험을 통해 검증하는 과정까지 얼마나 효과적으로 이어갈 수 있느냐에 달려 있다”며 “AI의 추론과 실제 실험을 긴밀하게 연결해 복잡한 과학 연구를 반복 가능한 체계로 만들겠다”고 말했다.
0 / 300