onepot-Bench 0: 실험실 인지형 인실리코 (in silico) 화학 벤치마크를 향하여
요약
언어 모델의 합성 화학 역량을 평가하기 위한 새로운 벤치마크인 onepot-Bench 0를 소개합니다. 이 벤치마크는 화학 정보학 문해력, 안전성 및 거부 행동, 그리고 비공개 데이터를 활용한 반응 결과 예측 능력을 종합적으로 측정합니다.
핵심 포인트
- 실험실 과학 역량 측정을 위한 독자적 벤치마크 onepot-Bench 0 제안
- ChemAbacus를 통한 화학 정보학 및 수치 추론 능력 평가
- SynthRefusal를 통한 약물 설계 관련 안전성 및 거부 행동 검증
- SynthBench를 활용한 실제 실험 데이터 기반 반응 예측 및 촉매 선택 평가
언어 모델 (Language models)은 실험 계획, 실행 및 사후 분석 (post-hoc analysis)과 같은 작업을 수행하며 실험실 과학에서 점점 더 중요한 역할을 하고 있습니다. 그러나 과학적 역량은 문제 해결 능력과 도메인 특화적 직관 (domain-specific intuition)이 모두 필요하기 때문에, 이들의 능력을 정확하게 측정하는 것은 어렵습니다. 기존의 평가 방식은 실제 물리적 실험실에서 신뢰할 수 있는 결정을 내리는 데 필요한 역량을 측정하는 경우가 드물며, 모델 학습 코퍼스 (training corpora)에 이미 포함되었을 가능성이 있는 공개 데이터에 의존하는 경우가 많습니다. 우리는 습식 실험실 (wet-lab) 실행과 관련된 합성 화학 역량에 대해 언어 모델을 평가하기 위한 독자적인 벤치마크 제품군인 onepot-Bench 0를 소개합니다. onepot-Bench 0는 세 가지 상호 보완적인 평가로 구성됩니다: ChemAbacus는 도구 없는 화학 정보학 문해력 (cheminformatics literacy) 및 수치 추론 (numerical reasoning)을 측정합니다; SynthRefusal는 다양한 양성, 통제된, 그리고 설계된 약물 (designer-drug) 타겟에 걸친 안전성 및 거부 행동 (refusal behavior)을 특징짓습니다; 그리고 SynthBench는 우리 실험실에서 생성된 비공개 실험 데이터를 사용하여 반응 결과 예측 (reaction-outcome prediction) 및 촉매 선택 (catalyst selection)을 평가합니다. 이러한 평가들은 종합적으로 기초 역량, 신뢰성, 그리고 더 깊은 지식을 조사하며, 이 모든 것들은 실험실에서의 신뢰할 수 있는 수행을 위해 요구되는 기술들입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 arXiv cs.LG의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기