Asta의 빠른 보고서 생성 모델, AstaBrief를 오픈소싱하다
요약
Asta는 과학적 보고서 생성을 위해 특별히 훈련된 오픈 가중치 모델 AstaBrief 8B를 공개했습니다. 이 모델은 연구 질문과 검색 문헌을 인용 기반의 보고서로 변환하는 데 초점을 맞췄습니다. 이를 통해 기존 독점 모델 대비 보고서 생성 시간을 크게 단축하고, 기관이 자체 인프라에서 민감한 데이터를 다룰 수 있도록 했습니다.
핵심 포인트
- AstaBrief 8B는 과학적 보고서 생성을 위해 특화된 오픈 가중치 모델입니다.
- 보고서 생성 시간이 기존 독점 모델 대비 현저히 단축되어 효율성이 높습니다.
- 오픈 소싱을 통해 연구자들이 접근 방식을 재현하고 발전시킬 수 있습니다.
- 로컬 환경에서 민감한 데이터를 다룰 수 있도록 자체 인프라 구동이 가능합니다.
언어 모델은 이미 연구자들이 문헌을 검색하고, 증거를 종합하며, 복잡한 질문들을 처리하는 데 도움을 줄 수 있습니다. 하지만 과학적 작업은 이러한 모델에 특별한 요구 사항을 부과합니다. 즉, 답변은 반드시 증거에 근거해야 하며, 모델은 연구의 결론을 은근히 확장하기보다는 실제로 증거가 지지하는 바를 보존해야 하고, 연구자들은 최종 출력을 검증할 수 있어야 합니다.
우리는 과학자들이 Asta라는 우리의 에이전트 플랫폼으로 작업하는 방식에서 이러한 점들을 확인했습니다. 사용자들은 단순한 키워드 검색 대신 상당한 맥락과 많은 제약 조건을 가져옵니다. 예를 들어, 특정 방법론, 인구 집단 또는 환경을 고려하면서 광범위한 문헌 전반에 걸쳐 접근법을 비교하도록 Asta에게 요청하는 식입니다. 또한 많은 사용자들이 생성된 보고서를 나중에 다시 참고하며, 이를 일회성 답변이 아닌 작업 중인 연구 결과물로 취급합니다.
우리는 과학자들이 인용된 보고서를 더 빠르게 생성할 수 있도록 돕고 싶었고, 그들이 직접 다운로드하여 실행할 수 있는 모델을 만들고자 했습니다. 이를 위해, 우리는 작고 오픈된 모델을 개발하여 이것이 과학적 보고서 생성을 위해 특별히 훈련되었으며, 우리가 사용하던 독점 모델의 보고서 품질과 맞먹으면서도 생성 시간과 서비스 비용을 줄일 수 있는지 테스트했습니다.
우리는 연구 질문과 검색된 문헌 발췌문을 인용된 보고서로 변환하는 AstaBrief 8B를 구축했습니다. AstaBrief는 오늘날 Asta의 '보고서 생성(Generate a report)' 기능에서 Claude 기반의 Thinking 모드와 함께 Fast 모드로 제공되며, 또한 다른 사람들이 우리의 접근 방식을 연구하고 재현하며 발전시킬 수 있도록 모델과 학습 데이터 모두 오픈소싱합니다.
AstaBrief를 개발하기 위해서는 수만 건의 실제 연구 질의(query), 인용 중심 필터링 데이터, 선호도 데이터, 그리고 섹션별이 아닌 한 번에 전체 보고서를 작성하는 재설계된 보고서 생성 파이프라인이 필요했습니다. 그 결과, 저희가 추적했던 독점 모델들과 비교했을 때 보고서 생성 시간이 거의 한 자릿수(order-of-magnitude) 수준으로 단축되었습니다. 전체 Asta 파이프라인에서 Fast 모드는 보고서당 평균 51.1초가 소요되는 반면, Thinking 모드에서는 178.5초가 소요되어 약 3.5배 더 빠릅니다.
이러한 효율성 증가는 AstaBrief를 더 광범위한 목표의 유용한 테스트 케이스로 만들었습니다. 즉, 과학적 작업의 특정 요구 사항에 맞춰 조정될 수 있는 오픈 언어 모델을 구축하는 것입니다.
오픈 가중치(Open weights)는 또한 기관들이 자체 인프라에서 AstaBrief를 실행할 수 있게 해주는데, 이는 연구 질문이 민감하거나 미발표된 작업을 드러낼 때 필수적입니다. 모델 가중치와 함께, 저희는 연구자들이 자신들의 PDF 파일로부터 보고서를 생성하는 데 적응시킬 수 있는 예제 워크플로우도 공개하여 로컬(local) 보고서 생성을 위한 출발점을 제공합니다.
본 게시물에서는 AstaBrief를 어떻게 훈련했는지, 과학적 증거에 근거하도록 하는 과정에서 무엇을 배웠는지, 그리고 저희 접근 방식 중 어떤 부분이 미래의 과학 모델로 이어질 수 있다고 생각하는지를 다룹니다. 설명된 대부분의 훈련 및 평가는 2025년에 완료되었기 때문에, 훈련 데이터를 생성하고 비교 지점으로 사용된 독점 모델들은 당시의 최전선(frontier)을 반영합니다. 저희는 오늘날의 최전선 모델들을 대상으로 전체 평가를 다시 수행하지 않았습니다. 따라서 아래 결과들은 우리가 테스트한 특정 훈련 및 시스템 설계 선택에 대한 증거로 읽는 것이 가장 좋습니다.
AstaBrief의 목표는 장문의 과학적 종합(scientific synthesis)에 가장 중요한 모든 자질, 즉 답변 품질, 관련성, 구조, 그리고 인용 근거를 갖춘 오픈 가중치 모델을 구축하는 것이었습니다. 저희는 Qwen3-8B에서 시작하여 대부분의 노력을 사후 훈련 데이터(post-training data), 평가, 그리고 주변 보고서 생성 스캐폴딩(scaffolding)에 집중했습니다.
일반 목적 모델을 과학 분야 작업에 맞게 조정하거나(Adapting general-purpose models for scientific work) 처음부터 새로운 과학 모델을 훈련하는 것(training new scientific models from scratch)은 Ai2 전반에서 광범위하게 탐구하고 있는 영역입니다. Ai2가 주도하는 미국의 국가 이니셔티브인 NSF OMAI를 통해, 저희 연구원들은 과학적 발견을 위한 완전한 오픈 AI 인프라와 모델을 구축하기 위해 과학 커뮤니티와 직접 협력하며 미래의 오픈 모델이 무엇을 필요로 하는지, 그리고 오늘날의 일반 목적 모델들이 어디에서 부족한지를 이해하는 작업을 진행하고 있습니다. 여기에는 과학 분야 및 워크플로우 전반에 걸쳐 요구사항이 어떻게 다른지를 연구하는 것이 포함되며, 이 연구를 통해 얻은 더 많은 결과들을 향후 공유할 예정입니다.
최근의 작업들, 예를 들어 저희 DR Tulu가 보여주었듯이, 강화학습(RL) 기반 방법론은 특히 평가 모델(judge models)이 훈련 루프에 관여할 때 오픈 가중치 모델의 장문 보고서 생성 능력을 향상시킬 수 있음을 보여주었습니다. 저희는 AstaBrief를 위해 이 경로를 고려했지만, 궁극적으로는 지도 미세 조정(SFT)과 직접 선호 최적화(DPO)를 중심으로 구축된 더 간단한 방식을 선택했습니다.
RL 기반 훈련은 불안정하고 비용이 많이 들 수 있습니다. 저희는 더 저렴하고 운영상 관리하기 쉬우며, 디버깅과 반복 작업이 더 용이한 환경에서 보고서 생성 품질을 얼마나 끌어올릴 수 있는지 확인하고 싶었습니다.
그것이 훈련 데이터의 품질을 특히 중요하게 만들었습니다. 노이즈가 있는 예제들(noisy examples)을 보상하기 위해 더 복잡한 최적화 방식에 의존하기보다는, 저희는 프로젝트 시간의 상당 부분을 우리가 실제로 원하는 보고서 작성 행동을 보여주는 예제들을 어떻게 생성하고, 선택하고, 필터링할지 알아내는 데 썼습니다.
또한 AstaBrief가 더 빨라지기를 원했기 때문에 사용자들이 초기 보고서를 빠르게 받아보고 이후 턴(turn)에서 반복적으로 개선할 수 있도록 했습니다. 속도 향상을 위해, 우리는 AstaBrief가 사용자 질의와 관련 검색 스니펫을 기반으로 최종 보고서를 단일 패스(one pass)로 직접 생성하도록 훈련하기로 결정했습니다. 이는 우리의 Claude 기반 Thinking 모드가 사용하는 값비싼 스니펫 요약 및 클러스터링 단계와 섹션별로 답변을 작성하는 과정을 우회하는 방식입니다. 흥미롭게도, 우리는 성능 저하 없이 그렇게 하는 것이 가능함을 발견했습니다.
훈련 파이프라인은 논문 “Synthesizing scientific literature with retrieval-augmented LMs”에서 설명한 시스템과 Asta의 보고서 생성 기능의 기반이 된 프레임워크인 ScholarQA를 통해 제출된 실제 사용자 질의로 시작되었습니다. 합성 프롬프트나 벤치마크 스타일 작업에만 훈련하는 대신, 우리는 AstaBrief가 실제 과학자들의 실제 질의로부터 학습하기를 원했습니다.
우리의 연구는 과학자들이 언어 모델에게 일반 목적 채팅봇이나 전통적인 검색 도구 사용자들보다 종종 다른 것을 요청한다는 것을 시사합니다. 수십만 건의 Asta 질의 분석에서, 전문 연구원들은 짧은 키워드 스타일 프롬프트에 의존하기보다는 상당한 컨텍스트(context), 여러 제약 조건(constraints), 그리고 개념 간의 관계를 자주 제공했습니다.
최근의 Asta 사용자 연구에서는 또한 연구자들이 자신의 작업에 AI가 관여하는 방식에 차이가 있다는 점이 드러났습니다. 일부는 아이디어 구상이나 실험을 위해 모델을 사용하는 데 편안함을 느끼는 반면, 다른 사람들은 합성(synthesis), 문헌 감시(literature surveillance) 또는 패턴 찾기에서 더 좁은 역할을 선호합니다. 이러한 차이점 전반에 걸쳐, 참가자들은 명확한 출처 추적성(source traceability), 모델이 무엇을 하고 있는지에 대한 더 많은 가시성(visibility), 그리고 사용되는 컨텍스트에 대한 더 큰 통제권을 원했습니다.
우리는 수집한 사용자 로그를 품질, 관련성, 개인정보 보호 측면에서 필터링하여 베타 테스터 및 봇 트래픽을 제거하고, 의미 있는 내용으로 보기에는 너무 짧은 질의는 삭제했으며, LLM 기반 필터링 단계를 사용하여 비영어권 질의, 비과학적 요청, 그리고 개인 정보를 포함하는 프롬프트를 걸러냈습니다. 그 결과 연구 중심의 질의 9만 건이 남았습니다.
SFT(Supervised Fine-Tuning)를 위해, 우리는 Asta의 보고서 생성 뒤에 있는 다단계 ScholarQA 파이프라인을 사용하여 필터링된 질의로부터 전체 보고서 목표 출력을 생성했습니다. 이 파이프라인은 관련 문헌을 검색하고, 자료를 섹션별로 구성하며, 백업 보고서 생성 모델을 사용하여 증거를 인용된 보고서로 종합했습니다. 우리는 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, 그리고 GPT-4.1 등 다양한 독점 시스템을 활용했습니다. 품질 필터링 후, 이는 4만 7천 개의 사용 가능한 학습 예시를 산출했습니다.
DPO(Direct Preference Optimization)는 다른 종류의 학습 데이터를 필요로 했습니다. 질의당 단일 목표 보고서 대신, 어느 것이 더 선호되는지 쌍을 이루는 보고서가 필요했습니다.
우리는 SFT 데이터 생성에 사용되지 않은 별도의 질의 하위 집합으로부터 이러한 쌍들을 구축했습니다. 질의당 하나의 보고서는 기존 ScholarQA 파이프라인에서 나왔으며, 일반적으로 Claude 3.5 Sonnet 또는 3.7 Sonnet을 백업으로 사용했습니다. 경쟁하는 보고서는 ScholarQA가 검색한 문헌 발췌문을 다른 모델(예시마다 o3, o4-mini, DeepSeek-V3, 또는 DeepSeek-R1)에 입력하여 생성되었습니다.
두 개의 심사 모델인 GPT-4.1과 DeepSeek-R1이 각 쌍을 비교하고 승자를 선택했습니다. 우리는 LLM 심사관들이 인간의 선호도와 일치하도록(95% 일치율) 보장했으며, 두 심사관 모두 동의한 쌍만을 유지함으로써 더 깨끗한 선호도 세트를 얻었고, 대규모로 생성된 선호도 데이터에서 일반적으로 나타나는 많은 노이즈를 제거할 수 있었습니다.
품질 필터링 후, 최종 DPO 데이터셋은 약 6천 개의 예시가 되었습니다.
여러 생성기(generator)를 사용하고 두 명의 심사위원(judge) 간의 합의를 요구함으로써, 단일 모델의 출력이나 판단을 진실(ground truth)로 취급하지 않고도 선호도 데이터(preference data)를 비교적 간단하게 구축할 수 있었습니다.
우리의 주요 평가 목표는 200개의 사용자 작성 컴퓨터 과학 연구 질문으로 구성된 SQABench-CS2였습니다. 우리는 AstaBrief 개발 과정 전반에 걸쳐 네 가지 지표를 추적했습니다:
루브릭 점수(Rubric score): 보고서가 필요한 콘텐츠를 얼마나 많이 다루었는지 측정합니다.
답변 정밀도(Answer precision): 각 단락이 질문과 관련성이 있는지 측정합니다.
인용 정밀도(Citation precision): 각 인용이 첨부된 주장을 뒷받침하는지 측정합니다.
인용 재현율(Citation recall): 보고서의 주장들이 제공된 인용에 의해 완전히 뒷받침되는지 측정합니다.
최종 모델을 위해, 우리는 또한 2차 평가를 수행했습니다. 이는 최근 ArXiv 논문들로 구축된 장문 연구 종합(long-form research synthesis)을 위한 63개 질문 벤치마크인 DeepScholarBench와, Claude 기반 파이프라인이 생성한 보고서들과의 두 가지 개별적인 쌍 비교 평가였습니다. 이에는 SQABench-CS2에 대한 LLM 심사 비교와 소규모 인간 연구가 포함되었습니다.
보고서는 세련되고 완벽하게 들리면서도 질문에서 벗어나 헤매거나, 근거 증거가 따르지 않는 주장들에 인용을 붙일 수 있습니다. 과학적 종합(scientific synthesis)의 경우, 우리는 이러한 행동들을 개별적으로 측정할 필요가 있었습니다. 그러나 인용 지원(citation support)은 과학적 충실성(scientific faithfulness)의 일부일 뿐입니다. 모델이 올바른 연구를 인용하더라도 그 연구 자체가 뒷받침하는 것보다 더 강력한 주장을 할 수 있습니다. 이는 예를 들어, 특정 샘플에 대한 발견을 전체 모집단에 관한 일반적인 주장으로 바꾸거나, 과거 시제로 보고된 결과를 보편적으로 참인 것처럼 들리는 현재 시제 진술로 전환하거나, 설명적 발견(descriptive finding)을 임상의, 정책 입안자 또는 연구자가 해야 할 것에 대한 권고(recommendation)로 바꾸는 방식으로 발생할 수 있습니다.
이러한 종류의 일반화는 과학 보고서 생성에 특히 중요합니다. 왜냐하면 각 단계가 명백히 거짓인 진술을 도입하지 않으면서 증거의 명시적 범위를 넓힐 수 있기 때문입니다. 따라서 인용된 문장은 연구자들이 실제로 확립한 내용을 과장하고 있을지라도, 출처와 기술적으로 관련이 있을 수 있습니다. 저희 개발 지표는 주로 관련성(relevance), 포괄성(coverage), 그리고 인용 근거화(citation grounding)에 초점을 맞췄으며, 과학 보고서 작성자에 대한 더 풍부한 평가는 그들이 출처의 주장 범위를 유지하고 강도를 보존하는지 여부를 테스트해야 합니다.
저희가 진행한 첫 SFT(Supervised Fine-Tuning) 실행은 전반적인 콘텐츠 품질을 개선했지만, 답변 정밀도와 인용 품질 면에서 저희 Claude 기반 보고서 생성 파이프라인에 미치지 못했습니다. 다시 말해, 모델은 보고서를 작성하는 능력은 향상되었지만, 과학적 종합(scientific synthesis)에 필요한 만큼 일관되게 증거에 근거하지는 못했습니다.
이는 저희가 데이터 품질에 더 많은 시간을 할애하도록 만들었습니다. 저희는 약한 합성 학습 예시를 식별하기 위해 네 가지 통계 기반 필터를 테스트했습니다:
출력 대 입력 토큰 비율(Output-to-input token ratio). 매우 높은 비율을 가진 답변은 너무 적은 증거로부터 많은 텍스트를 생성했기 때문에 종종 노이즈가 많았습니다.인용 관련성(Citation relevance). 학습 세트의 각 합성 보고서에 대해, 인용된 논문들의 검색 관련성 점수를 평균화했습니다. 낮은 평균값은 해당 보고서가 순위가 낮은 증거에 너무 크게 의존하고 있음을 시사했습니다.인용 밀도(Citation density). 최소한 하나의 인용을 가진 진술의 비율을 측정했습니다. 인용 밀도가 낮은 보고서는 지원되지 않은 텍스트가 큰 구간을 차지하는 경우가 많았습니다.인용 다양성(Citation diversity): Claude 기반 보고서 검색 파이프라인에 의해 반환된 세트를 고려하여 답변에서 인용된 논문의 비율을 측정했습니다. 낮은 점수는 해당 보고서가 몇몇 논문에 지나치게 의존하고 있음을 시사했습니다.
가장 큰 개선은 인용 밀도가 낮은 합성 보고서를 필터링하는 것에서 나왔으며, 더 공격적인 필터링, 필터 조합, 그리고 학습률 스윕(learning-rate sweeps)은 의미 있는 추가 이득을 가져오지 못했습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 HuggingFace Blog의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기