ABOUT ME

-

Today
-
Yesterday
-
Total
-
  • Paper2Agent
    논문 2025. 9. 10. 16:18

    Abstract

    연구 논문을 AI 에이전트로 변환하는 자동화된 프레임워크이다.

    Paper2Agent는 연구 결과물을 수동적인 산출물에서 능동적인 시스템으로 전환하여, 후속 활용, 채택, 그리고 발견을 가속화한다. 기존의 연구 논문은 독자가 자신의 작업에 논문의 코드, 데이터, 그리고 방법을 이해하고 적용하기 위해 상당한 노력을 기울여야 하며, 이는 확산과 재사용에 장벽을 만든다. Paper2Agent는 논문을 지식이 풍부한 연구 조수 역할을 하는 AI 에이전트로 자동 변환함으로써 이 문제를 해결한다.

    이 프레임워크는 다중 에이전트를 사용해 논문과 관련 코드베이스를 체계적으로 분석하여 Model Context Protocol(MCP) 서버를 구축한 뒤, 반복적으로 테스트를 생성하고 실행해 결과 MCP를 정제하고 견고하게 만든다. 이렇게 생성된 논문 MCP는 Claude Code와 같은 채팅 에이전트에 유연하게 연결될 수 있으며, 원 논문의 도구와 워크플로우를 호출하면서 복잡한 과학적 질의를 자연어로 수행할 수 있다.

    심층적인 사례 연구를 통해 Paper2Agent가 신뢰할 수 있고 유능한 논문 에이전트를 만드는 효과성을 입증한다. Paper2Agent는 AlphaGenome을 활용해 유전체 변이를 해석하는 에이전트와, ScanPy 및 TISSUE를 기반으로 단일세포 및 공간 전사체 분석을 수행하는 에이전트를 생성하였다. 우리는 이러한 논문 에이전트들이 원 논문의 결과를 재현할 수 있으며, 새로운 사용자 질의 또한 정확히 수행할 수 있음을 검증하였다.

    정적인 논문을 동적인 상호작용형 AI 에이전트로 전환함으로써, Paper2Agent는 지식 확산을 위한 새로운 패러다임을 제시하고 AI 공동 과학자들의 협력 생태계에 기반을 마련한다


    Introduction

    논문은 근본적으로 수동적인 객체이다. 독자는 논문을 찾아내야 하고(수많은 출판물 속에서 결코 쉬운 일이 아니다), 그 기여를 해석하며, 이를 자신의 작업에 어떻게 적용할지 수동으로 결정해야 한다. 특히 논문이 새로운 계산 방법을 설명하는 경우, 그 방법을 새로운 데이터에 사용할 수 있기까지 상당한 기술적 장벽이 남아 있는 경우가 많다. 독자는 해당 코드 저장소를 찾아내고, 의존성을 설치하며, 환경을 구성하고, 올바른 입력과 출력을 해석해야 할 수도 있다.

    예를 들어, AlphaGenome을 생각해보자. 이는 유전체 규모의 기초 모델링을 위한 강력한 프레임워크를 제공한다. 그 유용성에도 불구하고, 이 시스템은 설치 및 배포에 상당한 기술적 전문성을 요구하며, 그렇지 않으면 혜택을 볼 수 있는 생물학자들의 접근성을 제한한다. AlphaGenome을 코드로 사용하는 과정에는 환경 설치, 여러 모듈 임포트, API 키가 포함된 클라이언트 객체 생성, 염색체·변이 객체 같은 입력 구성 및 원하는 출력 양식 선택이 포함된다. 사용자는 API 계층 구조와 매개변수 의미를 이해해야 하며, 이는 이러한 추상화에 익숙하지 않은 생물학자들에게 학습 곡선을 요구한다.

    이는 더 광범위한 도전을 보여준다. 연구 결과물은 기술적 장벽 뒤에 수동적으로 고립되어 있다. Paper2Agent는 정적인 논문을 능동적인 AI 에이전트로 전환함으로써 연구 확산을 새롭게 상상한다. 각 에이전트는 해당 논문에 대한 상호작용형 전문가로서, 그 방법을 시연하고, 적용하며, 새로운 프로젝트에 맞게 적응할 수 있다.

     

    AI 에이전트는 외부 도구와 자원을 활용하여 작업을 추론하고 목표를 달성하기 위해 행동할 수 있는 자율 시스템이다. 현대의 AI 에이전트는 일반적으로 외부 도구나 API와 연결된 대규모 언어 모델(LLM)에 의해 구동된다. 이들은 추론을 수행하고, 특수화된 모델을 호출하며, 피드백을 기반으로 적응할 수 있다. 에이전트는 정적인 모델과 달리 상호작용적이고 적응적이다. 고정된 출력을 반환하는 대신, 다단계 행동을 취하고, 문맥을 통합하며, 인간–AI 간의 반복적 협력을 지원할 수 있다. 특히 에이전트는 LLM 위에 구축되었기 때문에, 사용자는 인간 언어를 통해 에이전트와 상호작용할 수 있으며, 이는 과학자들에게 사용 장벽을 크게 줄여준다.

    최근의 발전은 발견을 가속화하는 에이전트의 가능성을 강조한다. 예를 들어, Virtual Lab 프레임워크는 생물학과 화학 전반에서 연구 프로젝트를 공동으로 설계하고 실행하는 AI 과학자 에이전트 팀을 조직한다. 유사하게, 구글의 AI 공동 과학자는 가상 협력자로서 가설 생성과 연구 제안 개발을 돕는다. Sakana AI의 공동 과학자는 아이디어 구상부터 출판에 이르기까지 연구 생애주기의 자동화를 목표로 한다. FutureHouse는 다양한 과학적 과제를 위해 설계된 AI 과학자 플랫폼을 제공한다. 이러한 범용 플랫폼과 더불어, 특정 도메인에 특화된 에이전트들도 등장하고 있다. 예를 들어, CellVoyager는 단일세포 오믹스 데이터를 자율적으로 분석하는 에이전트 시스템을 소개한다. Biomni는 다양한 생물학적 과제를 위한 AI 에이전트이다. 이러한 시스템들은 에이전트가 단순히 코드를 실행할 뿐만 아니라, 가설을 생성하고, 불확실성을 평가하며, 새로운 데이터셋에 방법을 적응시킬 수 있음을 보여준다. Paper2Agent는 이러한 새로운 패러다임을 보완하면서 개념을 일반화한다. 즉, 어떤 연구 논문이든 해당 논문에서 기술된 지식과 방법을 구현하는 에이전트로 변환될 수 있다.

    Paper2Agent는 과학 논문을 에이전트로 변환하는 자동화된 워크플로우를 제공한다.

    핵심 아이디어는 논문을 Model Context Protocol(MCP) 서버로 전달하는 것이다.

    MCP는 구조화된 API와 도구를 LLM 및 에이전트 프레임워크에서 직접 접근할 수 있도록 노출하는 표준화된 프로토콜이다.

    변환 과정은 다음을 포함한다:

    (i) 논문의 핵심 기여(데이터셋, 방법, 모델 또는 워크플로우)를 식별한다.

    (ii) 이를 MCP 서버를 통해 캡슐화하고, 입력, 출력, 사용 지침을 정의한다.

    (iii) MCP 서버를 LLM 기반 에이전트에 연결하여 자연어 질의와 자율 실행을 가능하게 한다.

    그 결과, 사용자는 논문에 질문하거나, 시연을 요청하거나, 새로운 데이터에 방법을 적용할 수 있다.

    예시로, Paper2Agent를 AlphaGenome에 적용하면 그 유전체 기초 모델이 MCP로 전달된다. 사용자가 저장소를 복제하고 의존성을 설정할 필요 없이, 단순히 “이 변이에 대한 AlphaGenome 예측을 생성하라.”, “이 변이가 근육 세포에서 염색질 접근성에 미칠 예상 효과를 해석하라.”, “관심 있는 세포 유형에서 스플라이싱 변이에 대한 AlphaGenome 예측 발현 변화를 시각적으로 비교하라.”라고 요청할 수 있다. Paper2Agent가 생성한 에이전트는 설정, 실행, 그리고 결과 표시를 처리하여, 계산 전문가와 실험 생물학자 모두가 이 방법에 접근할 수 있게 한다.

    연구 결과물을 더 실행 가능하고 접근 가능하게 만들기 위한 노력은 수년간 지속되어 왔다. 예를 들어, 엘스비어의 Executable Paper Grand Challenge 에서 제안된 실행 가능한 논문이나 최근의 Jupyter Notebook 기반 출판물은 서사적 텍스트와 실행 가능한 코드를 결합하려고 했다. 이러한 접근은 재현성을 높였지만, 여전히 충분히 참여하려면 상당한 기술적 숙련이 필요했다. Papers with Code 이니셔티브 또한 출판물과 오픈소스 저장소를 연결해 논문과 구현 간의 다리를 놓고자 했다. 이는 검색 가능성을 개선했지만, 여전히 코드 설치와 실행이라는 장벽이 남아 있었다.

    Paper2Agent는 이러한 흐름을 크게 확장한다. 즉, 논문은 자연어를 통해 접근할 수 있는 강력한 에이전트로 변환될 수 있다. 이전의 시도와 달리, Paper2Agent는 연구 결과물을 지식을 담은 문서나 코드베이스에서 실행과 대화를 할 수 있는 지식 있는 개체로 전환한다. 이는 정적인 확산을 넘어 상호작용적 협력으로 나아가는 새로운 과학적 소통 방식을 의미한다. 이 프레임워크는 채택 장벽을 낮추고, 고급 방법에 대한 접근을 민주화하며, 연구의 실천으로의 전환을 가속화한다.


    Results

    Paper2Agent 개요

    Paper2Agent는 최소한의 인간 입력으로 연구 논문을 상호작용형 AI 에이전트로 자동 변환하는 다중 에이전트 AI 시스템이다. 이 프레임워크를 통해 생성된 논문 에이전트는 다음과 같은 특징을 가진다:

    1. 상호작용적이고 사용하기 쉬움: 사용자는 자연어 프롬프트를 통해 복잡한 과학적 분석을 실행할 수 있으며, 프로그래밍 전문 지식이 필요하지 않다.
    2. 신뢰성과 재현성 보장: 논문 에이전트가 사용하는 각 도구는 참조 코드베이스의 보고된 결과 및 그림을 예제 데이터셋으로 검증한 후, 재현성을 보장하기 위해 고정된다. 이러한 설계는 잘못된 LLM-생성 코드 실행으로 인해 잘못된 과학적 결과가 발생할 수 있는 “코드 환각(code hallucination)”의 위험을 완화한다. 또한 코드 생성의 무작위성을 최소화하여 재현성을 더욱 강화한다. 마지막으로, 모든 도구는 투명성과 추적성을 제공하기 위해 원 논문의 코드 참조를 포함한다.

    MCP는 최근 LLM 기반 에이전트와 외부 자원을 연결하는 산업 표준이 되었으며, 맞춤형 통합 없이 데이터셋과 도구에 접근할 수 있는 통합 인터페이스를 제공한다. Paper2Agent는 이 생태계를 기반으로 두 가지 구성 요소를 포함한다:

    (i) 논문과 그 코드베이스에서 정보를 추출해 원격 MCP 서버를 구축하는 Paper2MCP

    (ii) 각 MCP 서버를 컨텍스트 제공자로 감싸 논문별 AI 에이전트를 인스턴스화하는 에이전트 계층(그림 1A).

    어떤 LLM이나 외부 에이전트도 추가 설정 없이 MCP를 통해 서버의 도구를 호출할 수 있다. 명확성을 위해 논문마다 하나의 MCP 서버와 하나의 논문 에이전트를 할당한다. 같은 접근법으로 관련 논문 그룹을 위한 MCP와 에이전트를 만들 수도 있다. 각 MCP 서버는 세 가지 핵심 구성 요소를 포함한다:

    1. MCP 도구(MCP Tools): 논문의 방법론적 기여를 캡슐화한 실행 가능한 함수이다. 예를 들어, 하나의 AlphaGenome MCP 도구는 유전 변이를 입력으로 받아, 해당 변이가 유전자 발현, 염색질 접근성, 기타 다양한 양상에 미치는 영향을 예측하고 시각화한다. 이러한 도구는 원활한 실행을 위한 사전 구성된 환경과 함께 제공된다.
    2. MCP 리소스(MCP Resources): 논문 본문, 관련 코드베이스, 데이터셋, 표, 그림과 같은 보조 자료를 포함한 정적 자산 저장소 역할을 한다. 예를 들어, AlphaGenome MCP 리소스에는 모델 학습에 사용된 훈련 데이터 링크가 포함된다. 모든 리소스는 효율적 질의와 AI 에이전트 통합을 가능하게 하기 위해 접근 가능하고 표준화된 형식으로 저장된다.
    3. MCP 프롬프트(MCP Prompts): 논문의 텍스트나 코드베이스에서 도출된 복잡하고 다단계 과학 워크플로우를 AI 에이전트가 따를 수 있도록 안내하는 간결한 지침을 포함한다. 예를 들어, Scanpy MCP 프롬프트는 단일세포 데이터의 전처리와 클러스터링 단계를 순차적으로 인코딩한다. 이러한 템플릿은 도구와 리소스를 조율하여 재현 가능하고 체계적인 분석을 보장하며, 효과적인 프롬프트 사용 장벽을 낮춘다.

    논문 MCP 서버는 Hugging Face Spaces 같은 플랫폼에 원격으로 호스팅될 수 있어, 로컬 의존성 문제를 제거한다. MCP는 통신을 표준화하여 AI 에이전트와의 안전하고 확장 가능한 통합을 가능하게 한다. 에이전트 계층은 각 Paper2MCP 서버를 컨텍스트 제공자로 감싸, 논문별 대화형 에이전트를 생성한다. 어떤 호환 가능한 LLM이나 에이전트도 이러한 서버에 연결하여 재현성 검증, 새로운 데이터 분석, 그림 재생성 등의 작업을 수행할 수 있다. 예를 들어, 사용자가 “이 논문의 방법을 새로 생성된 데이터셋에 적용하라”라고 요청하면, 에이전트는 자동으로 파이프라인을 실행하고, 결과를 생성하며, 해석 가능한 출력을 제공한다. 기술적 세부 사항을 추상화함으로써, 에이전트는 방법 채택의 장벽을 낮추고, 재현성을 보장하며, 연구자가 구현보다는 통찰에 집중할 수 있도록 돕는다.

    우리는 Claude Code와 함께 Paper2Agent를 구현하였다. Claude Code는 복잡한 코딩 작업 관리와 실시간 반복 디버깅에 특화된 AI 코딩 에이전트이다. 워크플로우는 논문과 관련된 코드베이스를 식별하는 것으로 시작한다(그림 1B).

    이후 두 개의 특화된 에이전트가 호출된다:

    필요한 소프트웨어 환경을 구성하는 환경 에이전트(environment agent)

    핵심 방법을 구현된 도구로 변환하는 추출 에이전트(extraction agent).

    이러한 도구는 자동 검사를 수행하는 테스트 에이전트(testing agent)에 의해 검증되며, 참조 출력과 일치할 때까지 코드와 환경을 정제한다. 검증이 끝나면 도구와 환경은 MCP 파이썬 파일로 패키징되어 Hugging Face와 같은 원격 서버에 배포될 수 있다. 마지막으로 논문 MCP 서버는 AI 에이전트와 연결되어, 자연어 질의를 통해 논문의 방법에 상호작용적으로 접근할 수 있는 완전한 기능의 Paper Agent가 만들어진다. 우리는 사례 연구에서 Claude Code를 하위 AI 에이전트로 사용했지만, 논문 MCP는 다양한 챗 에이전트에 유연하게 통합될 수 있다. MCP는 모듈식이므로, 여러 MCP를 동일한 챗 에이전트에 연결해 사용자가 여러 논문의 도구와 리소스를 동시에 활용할 수 있다.

     

    유전체 데이터 해석을 위한 AlphaGenome 에이전트

    첫 번째 사례 연구는 AlphaGenome 에이전트를 보여준다. AlphaGenome은 인간 DNA 서열에서 단일 뉴클레오타이드 변이나 돌연변이가 광범위한 조절 과정에 미치는 영향을 예측하도록 설계된 AI 모델이다. Paper2Agent는 AlphaGenome 논문을 상호작용형 AlphaGenome 에이전트로 변환하여 유전체 데이터의 자동 해석을 가능하게 한다. 사용자는 자연어 질의를 통해 이 에이전트를 활용하여 질병 관련 변이에 대한 인과 유전자를 우선순위화하고, 개별 변이의 조절적 영향을 명확히 하며, 특정 조절 기능을 가진 합성 DNA의 설계에 정보를 제공할 수 있다.

    Paper2Agent는 인간 개입 없이 개인용 노트북에서 약 3시간 만에 22개의 AlphaGenome MCP 도구를 생성하였으며, 이는 해당 방법론적 혁신을 포괄적으로 포함한다. 이 일회성 과정은 향후 활용 가능한 재사용 도구를 생산한다. 이러한 MCP 도구들은 기능 분석에서의 단일 및 배치 변이 점수화, 서열 수준의 예측, 조직 온톨로지 탐색, 그리고 광범위한 시각화 도구군에 걸쳐 있다(그림 2A).

    예를 들어, score_variant_effect()는 여러 조직과 세포 유형에서 유전자 발현, 스플라이싱, 염색질 접근성과 같은 다양한 양상에 걸친 유전 변이의 기능적 결과를 예측하는 MCP 도구이다. 보완적으로, visualize_variant_effects()는 조절적 영향을 해석하기 쉽게 만들어주는 양상별 시각화를 생성한다.

    중요하게도, Paper2Agent가 생성한 도구들은 유연하고 잘 주석 처리된 입력 매개변수와 함께 설계되었다. 예를 들어, visualize_variant_effects() 도구는 다양한 활용 사례에 적응할 수 있도록 풍부한 옵션 세트를 제공한다(그림 2B).

    주어진 유전 변이를 입력으로, AlphaGenome 에이전트는 분석할 생물종(인간 또는 생쥐)을 선택하고, 변이를 둘러싼 서열 문맥 길이를 조정하며, RNA-seq, ATAC-seq, ChIP-seq 히스톤 트랙과 같은 서로 다른 양상을 전환할 수 있다. 또한, 각 MCP 도구에는 원래 GitHub 소스 코드로 추적 가능한 링크가 내장되어 있어 투명성과 재현성을 보장한다. AI 에이전트를 AlphaGenome MCP와 연결함으로써 시스템은 AlphaGenome 에이전트를 생성한다.

    다음으로, 우리는 Paper2Agent가 생성한 AlphaGenome 에이전트를 수동으로 코드를 구성하고 실행하는 인간 전문가와 비교하여 수치 결과 및 그림을 산출하는 성능을 벤치마크하였다(그림 2C).

    우리는 AlphaGenome 튜토리얼에서 직접 15개의 예제 질의를 수동으로 선별하였다. 예를 들어,

    • “운동 뉴런 세포(CL:0000100)에 대한 ATAC-seq 예측을 사용하여 변이 chr3:58394738:A>T를 점수화하라. 이 세포 유형의 quantile_score는 얼마인가?”
    • “폐 조직(UBERON:0002048)에 대해 ’GATTACA’ 서열(길이를 2048로 패딩함)에 대한 DNase-seq 예측을 생성하라. dnase 메타데이터에서 nonzero_mean 값은 얼마인가?”

    AlphaGenome 에이전트는 이러한 질의에서 100% 정확도를 달성하여 모든 보고된 값을 정확히 일치시켰다. 일반화 가능성을 평가하고 원래 예제에 과적합되는 것을 방지하기 위해, 우리는 논문이나 코드베이스에 존재하지 않았던 새로운 질의 집합도 수동으로 선별하였다

    여기에는 이전에 테스트되지 않은 변이 위치, 대립 유전자 치환, 조직–세포 유형 문맥이 포함되었다. 예를 들어,

    • “근육 세포(CL:0000187)에 대한 DNASE 예측으로 변이 chr9:98765432:T>C를 분석하라. 근육 조직의 quantile_score는 얼마인가?”
    • “신경 줄기 세포의 히스톤 ChIP-seq 메타데이터를 분석하라. 신경 줄기 세포(CL:0000100)에서 H3K4me3의 nonzero_mean 값은 얼마인가?”

    AlphaGenome 에이전트는 이 새로운 질의에서도 다시 100% 정확도를 달성하여 예상되는 수치 출력을 충실히 생성했으며, 이는 원래 AlphaGenome 코드를 수동 실행하여 검증하였다.

    마지막으로, 우리는 AlphaGenome 에이전트가 GWAS 좌위 해석을 자동으로 수행하고 원 논문의 분석을 검증할 수 있음을 보여주었다. 우리는 원 AlphaGenome 논문에서 제시된 예시인 변이 chr1:109274968:G>T가 저밀도 지단백 콜레스테롤과 연관되는 이유를 해석하는 사례를 고려하였다(그림 2D). 사용 가능한 도구를 기반으로, AlphaGenome 에이전트는 이 작업을 해결하기 위한 단계별 계획을 구성한다. 이 계획에는 입력 파일 생성, 다중 양상에서의 변이 점수화, 형질 관련 조직을 위한 결과 필터링, 양상별 시각화(염색질 접근성, 히스톤 마크, 전사 인자 결합, 스플라이싱) 생성, 그리고 포괄적 해석 보고서 조립이 포함된다. 에이전트는 그런 다음 score_variant(), visualize_tf_binding()와 같은 구현된 도구를 사용하여 이러한 작업을 실행하며, 반복적인 관찰과 피드백을 통해 전략을 자동으로 정제한다. 최종 보고서는 다양한 양상과 조직에 걸친 증거를 통합하여 변이의 조절적 영향을 통합적으로 해석한다.

    흥미롭게도, AlphaGenome 에이전트는 가장 가능성 높은 인과 유전자로 SORT1을 우선시하는 반면, 원 논문은 CELSR2PSRC1을 강조하였다. 에이전트가 SORT1을 선호하는 이유는 두 가지이다:

    1. 높은 quantile 점수(0.99982)가 간에서 SORT1 발현에 강한 예측 영향을 나타냈기 때문이다. 여기서 quantile 점수는 변이의 예측 효과가 다른 변이와 비교해 얼마나 극단적인지를 반영한다.
    2. SORT1은 간세포에서 LDL/VLDL 분비에 직접 관여하는 단백질 sortilin을 암호화한다.

    우리는 GTEx eQTL 데이터를 수동으로 조회하여 이 변이가 간에서 SORT1의 유의미한 eQTL임을 확인하였다 (p = 1.1e-65). 그러나 CELSR2와 PSRC1 역시 높은 AlphaGenome quantile 점수(각각 0.99998)와 GTEx 간 eQTL에서 유의미한 연관성(p = 4.7e-46 및 8.5e-50)을 보였다. 이는 변이가 여러 인근 유전자의 eQTL인 복잡한 GWAS 좌위에서 인과 유전자를 확정하는 것이 본질적으로 어렵다는 점을 보여준다.

    이 불일치는 Paper2Agent의 핵심 강점을 부각한다. 즉, 단일 프롬프트만으로 사용자는 독립적인 모델 기반 증거를 통해 발표된 결론을 재평가할 수 있다. 원래의 해석을 고정된 것으로 취급하는 대신, 에이전트는 동적 가설 재평가를 가능하게 하며, 더 나아가 대규모로 여러 연구의 결론을 체계적으로 다시 검토할 수 있는 방법을 제공한다.

     

    불확실성 인지 단일세포 공간 전사체 분석을 위한 TISSUE 에이전트

    다음으로 우리는 TISSUE [18]에 대한 Paper2Agent가 생성한 논문 에이전트를 소개한다. TISSUE는 최근 발표된 논문으로, 불확실성을 인지하는 단일세포 공간 전사체 분석을 위한 새로운 방법을 개발하였다(그림 3A). 이 사례 연구는 흔한 상황을 반영한다. 새로운 방법론 논문이 출판되었을 때, 연구자들은 해당 방법을 자신의 데이터에 적용하고 싶어 하지만 코드베이스를 탐색하고, 환경을 구성하며, 방법의 기능과 입력 요구사항을 파악할 시간은 부족하다. Paper2Agent는 다양한 논문을 위해 즉시 사용 가능한 에이전트를 자동으로 생성하고, 입력 준비를 안내하며 방법이 수행할 수 있는 기능을 명확히 하는 Q&A 지원을 제공함으로써 이러한 문제를 해결한다.

    Paper2Agent는 TISSUE MCP 서버를 위해 6개의 도구를 생성했으며, 여기에는 공간 유전자 발현 예측, 예측 구간(prediction interval) 구축, 가설 검정, 예측, 차원 축소와 같은 불확실성 인지 후속 분석이 포함된다(그림 3A). 중요한 점은, TISSUE 에이전트가 상호작용형 안내자의 역할도 수행할 수 있다는 것이다(그림 3B). 예를 들어, “TISSUE MCP 서버를 기반으로, TISSUE에 필요한 입력은 무엇인가?”라는 프롬프트를 입력하면, 에이전트는 방법에 필요한 입력, 예상 출력, 이용 가능한 기능을 구조적이고 포괄적으로 설명한다. 이는 TISSUE 논문을 상호작용형 AI 에이전트로 변환시킨다. 사용자가 설명서나 코드를 직접 찾아보는 대신, 에이전트에게 TISSUE 사용법을 직접 물어보고 정확하고 실행 가능한 지침을 받을 수 있게 되는 것이다.

    다음으로 우리는 TISSUE 에이전트가 공간 전사체(ST) 예측을 위한 예측 구간을 구축할 수 있는 능력을 평가하였다. 우리는 에이전트에게 다음과 같은 프롬프트를 입력했다:
    “TISSUE를 사용하여 유전자 Acta2의 공간 유전자 발현 예측에 대한 예측 구간을 계산하라. 내 데이터는 다음과 같다: Spatial count matrix: Spatial_count.txt, Spatial locations: Locations.txt, scRNA-seq count matrix: scRNA_count.txt”.
    에이전트는 추가적인 사용자 개입 없이 TISSUE 파이프라인을 자동으로 실행하였다(그림 3C). 출력 결과는 사람이 동일한 파이프라인을 수동으로 실행했을 때 얻은 결과와 일치하였다. 이는 논문 에이전트가 단일 도구 실행을 넘어, 데이터 로딩과 전처리부터 보간(imputation)과 불확실성 추정에 이르기까지 전체 분석 워크플로우를 실행할 수 있음을 보여준다.

    마지막으로, 우리는 TISSUE 논문의 데이터 가용성(data availability) 섹션을 구조화된 레지스트리로 변환하여 MCP 리소스를 활용하는 방식을 보여준다. 이 레지스트리는 ST 데이터셋을 표준화된 메타데이터(예: 종, 조직 유형, 모달리티, 데이터 URL)와 조화시키며, 이를 Zenodo REST API와 같은 데이터 저장소 API를 통해 TISSUE 에이전트가 직접 접근할 수 있도록 한다(그림 3D). 사용자는 예를 들어 종(species)별로 데이터를 질의하고 필터링할 수 있으며, 여러 저장소를 수동으로 탐색할 필요가 없다. TISSUE MCP 도구와 결합하면, 사용자의 질의는 다음과 같을 수 있다:
    “이 논문에서 사용된 마우스 공간 전사체 데이터를 다운로드하고, TISSUE를 실행하여 공간 예측을 적용한 뒤 예측 구간을 생성하라.”
    그러면 TISSUE 에이전트는 자동으로 마우스 데이터를 필터링하고, 다운로드한 후, TISSUE 파이프라인을 적용한다.

     

    단일세포 데이터 전처리를 위한 Scanpy 에이전트

    다음으로 우리는 단일세포 데이터 분석에서 전처리와 클러스터링을 위해 Paper2Agent가 생성한 Scanpy 에이전트의 적용을 시연한다. Scanpy는 대규모 단일세포 전사체 데이터를 분석하기 위한 널리 사용되는 종합 패키지이다 [19]. 실제로, 단일세포 데이터 분석의 많은 워크플로우는 Scanpy의 전체 기능 중 일부에만 의존한다. 이를 고려하여, Paper2Agent는 전체 방법뿐만 아니라 논문의 특정 방법 일부도 도구로 변환할 수 있도록 지원하여, AI 에이전트가 특정 분석에 가장 관련 있는 기능만 노출할 수 있게 한다.

    우리는 Scanpy의 가장 일반적인 사용 사례, 즉 단일세포 데이터의 전처리와 클러스터링에 집중한다. Paper2Agent는 개인용 노트북에서 약 45분 만에 이 기능을 위한 7개의 도구를 생성한다. 여기에는 QC 지표를 계산하고 시각화하며, 세포와 유전자를 필터링하고, 더블릿(doublet)을 감지하는 quality_control() 함수와, 카운트 데이터를 정규화하는 normalize_data() 함수가 포함된다(그림 4A). 이를 통해 사용자는 단일세포 데이터에 대한 품질 관리를 Scanpy 에이전트에게 요청할 수 있다.

    실제로 많은 사용자는 전처리와 클러스터링을 위한 엔드 투 엔드(end-to-end) 워크플로우를 선호한다. 여기서 구현된 도구들은 올바른 순서대로 연속적으로 실행된다. 이러한 분석 워크플로우는 단일세포 분석에만 국한되지 않고, 많은 과학 분야에서 공통적으로 나타난다. 그러나 이러한 워크플로우 실행은 어려울 수 있다. AI 에이전트가 이미 올바른 작업 순서를 “알고 있거나”, 사용자가 명시적으로 순서를 지정하는 구조화된 프롬프트를 제공해야 하기 때문이다. 이러한 한계를 극복하기 위해 우리는 MCP 프롬프트를 사용하여 에이전트를 안내한다. MCP 프롬프트는 워크플로우를 표준화된 방식으로 인코딩하여, 도구가 올바른 순서대로 실행되도록 하고 사용자가 직접 에이전트를 수동으로 지시해야 하는 부담을 덜어준다. 중요한 점은, 이러한 MCP 프롬프트가 Paper2Agent에 의해 논문과 코드베이스에서 직접 도출된 것이며, 수동 큐레이션이 필요하지 않다는 것이다. 이러한 설계는 특히 단일세포 데이터 처리와 같은 복잡한 분석에서 재현성과 사용성을 동시에 향상시킨다.

    예를 들어, Paper2Agent가 생성한 Scanpy MCP 프롬프트는 표준적인 전처리 및 클러스터링 파이프라인을 인코딩한다. 여기에는 품질 관리, 정규화, 특징 선택, 차원 축소, 그래프 구축, 클러스터링, 세포 유형 주석이 올바른 순서로 포함된다(그림 4B). 프롬프트는 또한 분석 전에 데이터를 검사하여 적절한 매개변수를 선택하도록 Scanpy 에이전트에게 지시한다. 사용자는 단지 데이터 경로(예: data.h5ad)만 제공하면 되고, Scanpy 에이전트는 자동으로 워크플로우를 실행하고 분석 결과 요약을 제공한다.

    Scanpy 에이전트의 성능을 평가하기 위해, 우리는 Scanpy 코드베이스에 포함되지 않은 10x Genomics의 세 가지 공개 단일세포 데이터셋(Data availability)을 전처리하고 클러스터링하는 데 적용하였다. 우리는 Scanpy MCP 프롬프트를 호출하고 Scanpy 에이전트에게 다음과 같이 질의했다:
    “이 단일세포 데이터(data.h5ad)에 대해 표준 단일세포 전처리 및 클러스터링 파이프라인을 수행하라.”
    그림 4C에 나타난 바와 같이, 에이전트는 동일한 데이터를 처리하는 인간 연구자가 산출한 결과와 일치하는 출력을 생성하였다. 이는 MCP 프롬프트 기반 Scanpy 에이전트가 워크플로우 실행을 단순화하여, 고급 단일세포 분석을 보다 접근 가능하고 재현 가능하게 만들었음을 보여준다.


    Discussion

    연구 논문을 수동적인 출판물에서 상호작용형 AI 에이전트로 변환하는 프레임워크이다.

    Paper2Agent를 유전체학을 위한 AlphaGenome, 단일세포 분석을 위한 Scanpy, 공간 전사체학을 위한 TISSUE와 같은 여러 방법론적 발전 사례에 적용해 시연하였다. 이러한 예시들은 논문 에이전트가 연구 기여를 구현하고, 이를 자연어 상호작용을 통해 직접 접근할 수 있게 만드는 방식을 보여준다. 생성된 논문 MCP는 모듈형 단위로, 다양한 사용자 지향 에이전트와 연결될 수 있어 폭넓은 채택을 가능하게 한다. 출판과 실제 응용 사이의 장벽을 낮춤으로써, Paper2Agent는 과학적 발견이 어떻게 전파되고 실제로 활용되는지의 간극을 메우는 데 기여한다.

    우리의 초기 초점은 가장 명확한 사용 사례를 제공하는 방법론적 논문에 맞추었다. 이러한 논문은 일반적으로 알고리즘, 모델, 계산 워크플로우를 설명하며, 다른 연구자들이 이를 채택하기 원하지만 배포에는 상당한 기술적 전문성이 요구된다. 이를 에이전트로 변환하면 복잡한 소프트웨어 생태계를 익히는 부담 없이 새로운 문제에 방법을 적용할 수 있다. 향후에는 Paper2Agent를 데이터 자원(data resources)이나 발견(discovery) 논문과 같은 다른 형태의 연구 결과물에도 확장할 계획이다. 이 맥락에서 에이전트의 역할은 계산에서 해석, 큐레이션, 설명으로 이동할 수 있으며, 데이터셋 탐색을 안내하거나 새로운 통찰을 다양한 과학 공동체에 맥락화하는 역할을 할 수 있다.

    모든 논문이 원활하게 견고한 에이전트로 전환될 수 있는 것은 아니다. 원래 코드베이스가 불완전하거나, 문서화가 부족하거나, 해결되지 않은 오류를 포함하는 경우, Paper2Agent는 이를 신뢰할 수 있는 도구로 노출할 수 없다. 그러나 이러한 한계 자체가 유의미하다. 즉, 논문이 얼마나 쉽게 에이전트로 변환될 수 있는가는 재현성과 엄밀성을 측정하는 실용적 지표가 될 수 있다. 과학 공동체가 명확한 데이터와 코드 공개를 기대하게 된 것처럼, 우리는 기여가 에이전트로 번역되기 쉽게 구조화될 것을 기대하는 것이 자연스러운 확장이 될 것이라고 본다. 잘 문서화되고, 모듈화되며, 투명한 논문일수록 이 새로운 표준에 자연스럽게 부합하게 될 것이다.

    재현성과 에이전트화 용이성을 더 잘 정량화하기 위해, 우리는 논문에서 수동으로 평가한 예제와 일반화를 시험하기 위한 새로운 예제에 기반한 벤치마킹 접근법을 도입하였다. 이 접근법으로, AlphaGenome 에이전트가 튜토리얼 기반 질의와 새로운 질의 모두에서 100% 정확도를 달성했음을 보였다. 그러나 이 접근법은 해당 논문과 방법에 대한 전문가 지식, 그리고 수동 구현과 검토에 의해 제한된다. 향후 방향은 LLM-as-judge 평가와 같은 추가적인 에이전트 프레임워크를 통해 이 과정을 더욱 간소화하는 것이다.

    또 다른 고려 사항은 에이전트화의 규모이다. 논문은 전통적으로 과학적 소통의 단위이지만, 항상 에이전트화에 가장 적합한 단위는 아니다. 많은 분야에서 아이디어는 일련의 출판물을 거쳐 발전하며, 각 출판물은 개선, 벤치마크, 응용을 추가한다. 이러한 경우 가장 유용한 에이전트는 단일 논문이 아니라, 관련 연구들을 집약해 일관된 인터페이스로 통합한 것일 수 있다. 단일 MCP가 여러 관련 논문을 캡슐화할 수 있다. 우리는 Paper2Agent의 확장을 통해 이러한 더 넓은 범위를 유연하게 수용하는 작업을 진행할 계획이다.

    앞으로는 많은 학술지가 데이터 및 코드 공개 섹션을 요구하는 것처럼, 기여가 상호작용형 에이전트로 구현되었는지 여부와 그 방법을 명시하는 “에이전트 공개(agent availability)” 섹션이 등장할 것으로 예상한다. 이는 독자에게 즉각적인 유용성을 제공할 뿐 아니라, 저자들이 자신의 작업을 에이전트화에 적합한 형태로 제시하도록 동기를 부여할 것이다.

    마지막으로, 과학 지식이 정적인 산출물이 아니라 활성 에이전트에 인코딩되면, 그 잠재력은 개인적 활용을 넘어 확장된다. 에이전트들은 서로 상호작용하여, 방법을 데이터셋과 연결하거나 서로 다른 도메인에서 얻은 통찰을 결합할 수 있다. 예를 들어, 새로운 분석 방법을 대표하는 에이전트가 새로 발표된 데이터셋을 대표하는 에이전트와 협력하여, 어느 한쪽 산출물만으로는 수행할 수 없는 분석을 공동으로 만들어낼 수 있다. 이러한 에이전트 커뮤니티는 학문 간 연결을 가속화하는 동적이고 상호 운용 가능한 과학 지능 계층을 형성할 수 있다. 따라서 Paper2Agent는 과학적 소통이 단순히 결과를 설명하는 것을 넘어, 연구를 구현하고 확장하는 상호작용적이고 협력적인 실체를 창조하는 미래를 지향한다.

Designed by Tistory.