과학 연구 AI 인히런트, “패러데이가 클로드·GPT 앞섰다”


논문에는 성공만 적힌다. 저자가 어떤 방법을 먼저 시도했다가 버렸는지, 어떤 가정이 빗나갔는지는 지면에 남지 않는다. 그래서 남이 쓴 논문을 처음부터 다시 구현해보는 일은 대학원 신입생이 가장 먼저 겪는 훈련이면서, 동시에 과학에서 가장 품이 많이 드는 작업으로 꼽힌다. 결과 하나만 보고 거기에 이르기까지의 시행착오를 거꾸로 복원해야 하기 때문이다.

과학 연구 AI 인히런트,

런던의 AI 연구소 인히런트(Inherent)가 그 작업을 대신하는 AI 에이전트 ‘패러데이(Faraday)’를 공개했다. 회사는 패러데이가 논문 재현 능력에서 앤트로픽(Anthropic)의 클로드 오퍼스 4.8과 오픈AI(OpenAI)의 GPT-5.5를 앞섰다고 밝혔다. 단, 회사가 직접 설계한 시험대에서 나온 성적이고 제3자 검증은 아직 없다.

‘AI 과학자’는 무엇이 다른가

AI에게 연구를 맡긴다고 할 때 지금까지는 대개 두 가지였다. 논문을 요약하거나 질문에 답하게 하는 것, 그리고 실험 코드를 짜게 하는 것. 둘 다 사람이 “이걸 해달라”고 지시한 다음에 벌어지는 일이다.

업계가 ‘AI 과학자(AI Scientist)’라고 부르는 것은 그 앞단을 겨냥한다. 무엇을 물어야 하는지, 어떤 실험이 해볼 만한지를 AI가 스스로 정하게 하는 쪽이다. 인히런트에 투자한 인덱스 벤처스는 지금의 AI가 질문에는 답하지만 페니실린이나 전자레인지, GPU를 낳은 종류의 열린 호기심은 아직 못 낸다며, 그 빈칸을 노린 투자라고 설명했다.

어려운 대목은 채점이다. 답이 정해진 시험은 맞았는지 틀렸는지 바로 나오지만 “좋은 연구 방향”에는 정답표가 없다. 인히런트는 이 감각을 ‘연구 취향(research taste)’이라 부른다. 실험 설계가 타당한지, 원 논문의 주장에 충실한지, 주어진 시간과 연산을 잘 배분했는지 같은 것들이다.

그래서 회사는 논문 재현을 훈련장으로 골랐다. 재현에는 원래 그림이라는 채점 기준이 있어 점수를 매길 수 있고, 동시에 논문에 적히지 않은 시행착오를 스스로 메워야 해서 열린 탐색이 요구된다. 채점이 가능한 과제로 채점이 불가능한 능력을 기르는 셈이다. 수석과학자 에드워드 휴스는 박사과정 학생들도 실제로 이렇게 시작한다고 설명했다.

재현은 목적이 아니라 출발점이라는 게 회사 설명이다. 논문에서 그림 말고 다른 정보를 더 지우고, 시간과 연산 예산을 조이거나 풀고, 나아가 존재하지 않는 논문을 상상해 내주면, 같은 모델이 자기가 혁신하고 있다는 것도 모른 채 혁신하게 된다는 것이다.

270억 파라미터가 프런티어 모델을 부린다

패러데이의 기반 모델은 파라미터 270억 개 규모의 큐원(Qwen) 3.6이다. 비교 대상인 두 모델은 이보다 훨씬 큰 프런티어급이다. 회사는 두 모델을 각각 클로드 코드(Claude Code)와 코덱스(Codex) 환경에서 사고 강도를 최고로 올려 돌렸다고 밝혔다.

더 눈에 띄는 건 패러데이가 자기보다 큰 모델을 도구로 부린다는 점이다. 코딩은 GPT-5.5 코덱스에 맡긴다. 사람 과학자가 통계 패키지를 직접 만들지 않고 가져다 쓰는 것과 같은 구조다. 학습할 때는 더 작은 GPT-5.4 미니를 붙여 뒀는데도, 시험 단계에서 더 강한 코덱스를 지휘하는 데 그대로 적응했다. 자체 코딩 도구를 만들지 않은 것은 의도적인 선택이라는 게 회사 설명이다.

훈련용으로 만든 ‘레플리카(Replica)’는 강화학습 과제 묶음이다. 에이전트에게 논문 속 그림 하나를 원본 없이, 제한된 시간과 연산 안에서 재현하게 한다. 초기 과제는 머신러닝·과학용 AI 논문 100편에서 뽑은 310개로, 자연어처리부터 소재과학과 기상예측까지 걸쳐 있다. 회사는 모든 분야에서 앞섰고 메타러닝과 구조생물학, 소재과학에서 격차가 특히 컸다고 밝혔다. 최신 논문에서 덜 헤맸다는 점도 함께 내놨다. 기반 모델이 사전학습 때 본 적 없는 연구에도 통했다는 뜻이다.

채점 문제는 대규모언어모델을 심판으로 세워 풀었다. 다만 심판 모델이 매번 조금씩 다르게 판정해 보상 신호에 잡음이 끼는 약점이 있었다. 회사는 과제별 채점 루브릭을 만들어 이를 줄이고, 사람 평가와 얼마나 일치하는지 검증했다. 학습 중에는 심판을 여러 번 돌려 평균을 내고 에이전트의 매 턴에 점수를 나눠 주는 방식을 더했다.

이름은 19세기 실험물리학자 마이클 패러데이에서 왔다. 정규 교육을 거의 받지 못했던 그는 왕립연구소 지하실에서 남의 실험을 손으로 재현하다 전기모터를 발명했다.

백악관 AI 정책 담당자가 세운 공익법인

인히런트는 탄툼 콜린스(Tantum Collins)와 에드워드 휴스(Edward Hughes), 루이스 키르슈(Louis Kirsch), 칼로얀 알렉시에프(Kaloyan Aleksiev)가 창업했다. 앞의 셋은 구글 딥마인드(Google DeepMind) 출신이고 알렉시에프는 레카AI(Reka AI)와 마이크로소프트(Microsoft)를 거쳤다. 콜린스는 2021~2022년 백악관 과학기술정책실에서 기술전략 부국장을 지낸 AI 정책 전문가로, 딥마인드에서는 메타리서치 팀을 이끌었다. 휴스가 수석과학자를 맡고 있다.

회사의 창업 선언문은 1890년대 기계공을 1925년 공장에 데려다 놓는 장면으로 시작한다. 증기기관 하나에 축을 걸어 모든 기계를 돌리던 공장과, 기계마다 전기모터가 따로 달린 공장은 배치부터 다르다. 전기모터는 1890년에도 있었지만 공장 구조를 다시 짜기 전까지는 증기기관 자리를 대신하는 정도로만 쓰였다. 인히런트는 AI도 지금 그 상태라고 본다. 기존 연구실에 AI를 들여놓는 것만으로는 부족하고 연구 조직 자체를 다시 설계해야 한다는 주장이다.

회사는 지난 5월 28일 스텔스를 해제하며 5천만 달러 시드 투자를 유치했다고 발표했다. 인덱스 벤처스(Index Ventures)와 래디컬 벤처스(Radical Ventures)가 공동 리드했고, 엔비디아(NVIDIA)의 벤처투자 부문 엔벤처스(NVentures)와 Ex/Ante, 메타플래닛(Metaplanet), 매크로스코픽 벤처스(Macroscopic Ventures), 미토스 벤처스(Mythos Ventures)가 참여했다. 엔젤로는 허깅페이스(Hugging Face) 공동창업자 토마스 울프와 어뎁트(Adept) 창업자 데이비드 루안, 찰리 송허스트, 마이크 챨펜, 야콥 푀르스터, 맥스 야더버그, 드워케시 파텔이 이름을 올렸다. 앙트레프레너 퍼스트(Entrepreneur First) 공동창업자이자 영국 정부 AI 자문을 맡았던 맷 클리퍼드(Matt Clifford)는 어드바이저로 합류했다.

회사는 주식회사가 아니라 공익법인(PBC)이다. 주주 이익과 함께 사회적 영향을 고려할 법적 의무를 지는 형태로, 벤처 투자를 받은 AI 연구소로는 드문 선택이다. 현재 인원은 12명이고 전원이 런던 킹스크로스 사무실로 출근한다. 연말까지 20~25명으로 늘릴 계획이다.

AI 과학자를 만들겠다는 회사들

과학 연구 자체를 AI에 맡기려는 시도는 지난 1년 사이 부쩍 늘었다.

디스커버리 루프(Discovery Loop)는 구글의 전설적 엔지니어 제프 딘이 27년 근무를 마치고 나와 만든 회사다. 이달 초 AI 과학 자동화를 목표로 창업했다는 사실이 알려졌다.

페리오딕랩스(Periodic Labs)는 챗GPT 공동 개발자 리암 페더스가 창업해 물리·소재 분야 AI 과학자를 만든다. 프런티어 모델과 물리 시뮬레이션, 자율 로봇 실험실을 묶어 가설 수립부터 실험까지 한 바퀴를 돌리는 구조로, 지난해 10월 시드 단계에서 3억 달러를 유치했다.

릴라 사이언스(Lila Sciences)는 생명·화학·소재 분야에서 ‘과학 슈퍼인텔리전스’를 내세운다. 자율 실험실이 실험을 설계하고 수행한 뒤 다시 설계하는 방식으로, 지난해 3월 2억 달러를 유치했다.

국내에서는 바이오넥서스(BioNexus)가 AI 과학자 에이전트 플랫폼을 개발하며 이달 시드 투자를 유치했다.

이들 대부분이 자율 실험실이나 특정 과학 분야에서 출발한다. 반면 인히런트는 분야를 정하지 않고 ‘연구를 잘하는 감각’을 학습시키는 쪽에 걸었다. 로봇 팔이나 실험 장비 없이 논문과 코드만으로 시작한다는 점에서도 다르다.

검증되지 않은 자체 벤치마크라는 한계는 그대로 남는다. 다만 270억 개 파라미터 모델이 자기보다 수십 배 큰 모델을 도구로 부려 성과를 냈다는 구조는, 프런티어 모델 크기 경쟁과는 다른 층에서 승부가 갈릴 수 있다는 신호로 읽힌다. 회사는 연구 내용을 논문으로 함께 공개했다.

주요 AI 기업들의 투자 관계망에 대한 자세한 내용은 여기를 참고하시길.

이 기사는 영문기사로 발행되었습니다: Inherent Says Its 27B ‘AI Scientist’ Faraday Beat Claude Opus 4.8 and GPT-5.5 at Replicating Research

기사 공유하기

답글 남기기