에이전트형 AI 시대의 과학 컴퓨팅
새로운 현장 보고서는 연구자들이 유전체학을 비롯한 데이터 집약적인 분야에서 과학 소프트웨어를 현대화하기 위해 코딩 에이전트를 어떻게 활용하고 있는지 소개합니다.
과학 컴퓨팅은 학계와 산업계 전반에서 현대 연구를 뒷받침하는 핵심 기반입니다. 하지만 과학 데이터를 분석하는 데 필요한 소프트웨어는 급격히 증가하는 데이터 생성 속도를 따라가지 못하고 있습니다. 널리 사용되는 많은 연구 도구는 논문과 함께 공개된 코드에서 시작됐으며, 엔지니어링 경험이 많지 않은 소규모 연구팀이 패키징, 테스트, 최적화, 장기적인 유지보수에 충분한 시간을 들이지 못한 채 개발한 경우가 많았습니다. 그 결과, 과학 연구 인프라는 지속적인 유지보수가 필요한 느리고 취약한 워크플로에 의존하는 경우가 많으며, 이러한 제약은 연구의 진전을 더디게 만듭니다.
AI 에이전트는 이러한 상황을 바꾸기 시작했습니다. 엔지니어링 작업에 드는 비용을 줄이고 반복적이고 번거로운 구현 작업을 대신 수행함으로써, 연구자들이 아이디어를 더 빠르게 프로토타입으로 구현하고, 이전에는 현실적으로 추진하기 어려웠던 프로젝트에 도전하며, 장기적으로 소프트웨어를 더욱 쉽게 유지보수할 수 있도록 지원합니다. 그 결과 과학 소프트웨어는 더욱 효율적이고 안정적으로 유지되며, 연구자들은 소프트웨어 관리에 드는 시간을 줄이고 연구 자체에 더 집중할 수 있게 됩니다.
이번에 공개하는 탐색적 현장 보고서에서는 생명과학 분야를 중심으로 AI 에이전트의 지원을 받아 수행된 과학 컴퓨팅 프로젝트 8건을 소개합니다. 이 가운데 5건은 Codex만 사용했고, 나머지 3건은 Codex와 Claude Code를 함께 활용했습니다. 이 보고서는 각 프로젝트를 수행한 팀이 직접 작성한 사례 연구를 바탕으로 공통적으로 나타난 주요 특징을 정리했습니다. 프로젝트의 범위는 일상적인 유지보수와 목표 지향적인 최적화부터 대규모 언어 마이그레이션과 GPU 기반 재설계까지 다양합니다. 기여자들은 AI 에이전트가 소프트웨어 개발과 유지보수 속도를 크게 높였으며, 일부 프로젝트에서는 원래라면 훨씬 더 많은 시간이나 전문 엔지니어링 지원이 필요했을 작업도 소규모 팀이 수행할 수 있었다고 밝혔습니다. 한편, 이렇게 만들어진 도구에 대해 명확한 책임 체계와 장기적인 유지관리 체계를 마련하는 일은 여전히 해결해야 할 과제라고 강조했습니다.
기여자들은 연구자의 역할이 구현 중심에서 검증과 조율 중심으로 바뀌고 있다고 공통적으로 설명합니다. 즉, 무엇을 만들지 정의하고, 정확성을 어떤 기준으로 검증할지 정하며, 프로젝트를 언제 배포할 준비가 되었는지 판단하는 역할입니다. 이러한 새로운 작업 방식에서도 연구자는 연구의 방향과 품질 기준에 대한 주도권을 계속 유지하며, AI 에이전트의 지원을 통해 개발 속도를 한층 높일 수 있습니다.
널리 사용되는 유전체 데이터 파싱 라이브러리 현대화
cyvcf2는 유전체 변이 파일을 읽고 쓰기 위한 Python 라이브러리입니다. GPT‑5.5는 기존의 빌드 및 패키징 시스템을 현대적이고 통합된 프로세스로 교체해 라이브러리를 더욱 쉽게 설치하고, 테스트하고, 배포할 수 있도록 했습니다.
코딩 에이전트를 활용하면 빠르게 개발하는 것은 훨씬 쉬워졌습니다. 하지만 과학을 더 발전시키기 위해서는 여전히 전문가의 지도와 깊은 이해, 안목, 그리고 세심한 주의가 필요합니다.
— 브렌트 페더슨
프로젝트의 범위는 매우 다양했지만, 모두 코딩 에이전트가 과학 컴퓨팅에서 엔지니어링 인력과 전문성의 제약을 크게 줄일 수 있음을 보여주었습니다. 이제 가장 큰 병목은 AI 에이전트의 결과물을 검증하는 일이며, 이는 여전히 사람의 판단에 의존합니다.
사례 연구 전반에서 AI 에이전트는 범위가 명확한 작업은 효과적으로 수행했지만, 자신이 수행한 결과가 과학적으로 타당한지 또는 기대한 기준을 충족하는지를 신뢰할 수 있을 만큼 정확하게 판단하지는 못했습니다. 실제로는 결과에 명백한 오류가 있어도 AI 에이전트는 자신의 작업에 확신을 보이는 경우가 많았습니다. 따라서 검토자는 결과를 신뢰할 수 있는 방식으로 검증할 방법을 마련해야 했습니다. 가장 효과적인 방법은 외부 참조 기준이나 측정 가능한 검증 기준을 활용하는 것이었습니다. 예를 들어 결과가 완전히 일치하는지, 기존 도구와 동일한 결과를 내는지, 통계적으로 기대에 맞는 동작을 보이는지, 또는 시뮬레이션 데이터를 활용해 미리 정답을 마련해 두었는지 등을 기준으로 검증했습니다.
또 다른 공통점은 대부분의 프로젝트가 한 번에 완성하는 방식이 아니라, 피드백을 반영하며 반복적으로 개선해 나가는 단계적 접근 방식으로 진행됐다는 점입니다. 기여자들은 큰 목표를 더 작은 작업 단위로 나눈 뒤, 중간 벤치마크와 테스트 시스템을 활용해 AI 에이전트의 결과를 평가하고 지속적으로 개선했습니다. AI 에이전트는 초기 구현은 빠르게 완성하는 경우가 많았지만, 예외적인 상황을 처리하거나 미세한 수치 차이를 조정하는 데는 훨씬 더 많은 시간이 필요했습니다. 특히 구현의 마지막 완성 단계를 마무리하는 작업이 가장 많은 노력을 요구하는 경우가 많았습니다.
전반적으로 이러한 사례 연구는 AI 에이전트가 연구자들이 구현에 들이는 시간을 줄이고, 연구 자체를 이끌어가는 데 더 많은 시간을 할애할 수 있도록 돕고 있음을 보여줍니다. 연구자는 목표를 설정하고, 복잡한 프로젝트를 관리 가능한 작업 단위로 나누며, 결과가 과학적으로 타당한지 판단하는 역할을 맡습니다. AI 에이전트는 오랫동안 연구를 가로막아 온 엔지니어링상의 제약을 완화함으로써 연구자들이 구현할 수 있는 가능성을 넓히는 동시에, 가장 중요한 과학적 질문과 의사결정에 더욱 집중할 수 있도록 지원합니다.
연구 소프트웨어의 유지보수 공백은 오랫동안 반복적인 개선을 더디게 만들고, 연구 결과의 재현성과 신뢰성을 떨어뜨리는 요인으로 작용해 왔습니다. '연구 코드(새 창에서 열기)'와 오믹스 도구(새 창에서 열기)를 분석한 여러 연구에 따르면, 공개된 소프트웨어는 새로운 컴퓨팅 환경에서 제대로 설치되지 않거나 문서에 설명된 대로 실행되지 않는 경우가 많았으며, 이로 인해 연구자들은 환경 설정과 디버깅에 상당한 시간을 들여야 했습니다. 단순한 개선만으로도 연구자의 시간을 절약하고 컴퓨팅 자원 사용을 줄일 수 있으며, 성능을 중심으로 한 리팩터링이나 재구현은 그보다 훨씬 더 큰 효과를 가져올 수 있습니다.
하지만 구현 비용이 낮아지면서 비슷한 재구현이 쉽게 늘어날 수 있게 되었고, 그 결과 사용자가 여러 도구로 분산되고, 각 도구의 신뢰성을 유지하는 데 필요한 전문가의 관심과 노력도 흩어질 수 있습니다. 따라서 장기적인 유지관리 체계와 기여 관계를 명확히 하는 일이 더욱 중요해졌습니다. 성숙한 과학 소프트웨어에는 문서화되지 않은 관행, 호환성 요구사항, 그리고 사용자들의 신뢰가 축적되어 있으며, 이러한 요소는 소스 코드를 단순히 다시 구현하는 것만으로는 재현할 수 없습니다.
사례 연구는 앞으로 나아갈 수 있는 몇 가지 방향을 보여줍니다. MHCflurry와 cyvcf2에 적용된 변경 사항은 원래의 업스트림 프로젝트에 반영됐으며, rustar-aligner는 기존 프로젝트가 더 이상 유지되지 않게 되면서 새로운 커뮤니티의 관리 체계로 이관됐습니다. 기존 유지관리자와 협력할 수 있다면 가능한 한 이른 시점부터 협업을 시작하는 것이 바람직합니다. 별도의 구현이 필요한 경우에는 명확한 관리 주체와 신뢰할 수 있는 유지관리 계획이 마련되어야 합니다. 그렇지 않으면 오늘날의 현대적인 재구현이 신뢰할 수 있는 과학 인프라가 아니라, 내일의 또 다른 방치된 코드가 될 수 있습니다.
이번 현장 보고서는 기존 사례를 돌아보고 가능성을 탐색하기 위한 내용이지만, 사례 연구들은 과학 소프트웨어를 개발하는 방식에 실질적인 변화가 일어나고 있음을 보여줍니다. Codex와 같은 코딩 에이전트는 유지보수, 마이그레이션, 최적화, 새로운 구현에 드는 비용을 크게 줄일 수 있습니다. 하지만 이러한 도구가 장기적으로 과학적 가치를 발휘할지는 무엇을 만들고, 어떻게 검증하며, 누가 지속적으로 관리할지를 결정하는 사람의 판단에 달려 있습니다. 진정한 변화는 연구자들이 더 많은 소프트웨어를 만들 수 있게 되었다는 데 있는 것이 아니라, 도구를 정의하고, 검증하고, 지속적으로 관리하는 일에 더 많은 역량을 집중할 수 있게 되었다는 점입니다.
이번 사례 연구는 AI 에이전트가 이미 과학 컴퓨팅에서 반복적인 개발과 개선의 속도를 높일 수 있음을 보여줍니다. 코딩 에이전트가 더욱 발전함에 따라 연구자들은 분석 파이프라인을 유지하는 데 드는 시간을 줄이고, 자신의 연구 분야를 발전시키는 데 더 많은 시간을 쏟을 수 있을 것입니다.


