Ironclad와 함께 컴퓨터 사용 능력을 향상시키다
요약
본 기사는 AI 에이전트가 복잡한 전문 업무(예: 계약서 구성, 승인 절차)를 수행하는 능력을 향상시키는 연구 결과를 공유합니다. OpenAI는 Ironclad와 파트너십을 맺고, 실제 비즈니스 워크플로우 기반의 합성 훈련 작업을 개발하여 GPT-6 Astra 모델을 훈련시켰습니다. 그 결과, 이전 세대 모델 대비 성능과 효율성에서 큰 개선을 보였습니다.
핵심 포인트
- AI 에이전트는 단순 작업 수행을 넘어 다단계 비즈니스 워크플로우를 이해하고 실행해야 합니다.
- Ironclad와의 협력을 통해 실제 계약 분야의 복잡한 전문 지식을 모델 훈련에 반영했습니다.
- 합성 훈련 작업과 강화학습(RL) 조합은 모델의 실질적인 업무 능력을 향상시키는 핵심 방법론입니다.
- GPT-6 Astra는 기존 모델 대비 성능이 크게 개선되어, 실제 비즈니스 애플리케이션 적용 가능성을 높였습니다.
계약 분야의 연구 협업이 복잡한 전문 업무에 대한 AI 에이전트 훈련 및 평가를 어떻게 돕고 있는지 보여드립니다.
GPT-6 Astra를 소개했을 때, 우리는 문서 준비부터 웹사이트 테스트에 이르기까지 컴퓨터를 사용하여 전문적인 작업을 수행하는 데 있어 모델들이 얼마나 발전했는지 시연했습니다. 우리의 다음 목표는 에이전트가 특화된 소프트웨어를 사용하는 능력을 더욱 향상시키고 효율적으로 만들어 복잡한 비즈니스 문제를 해결하도록 하는 것입니다. 우리는 모델이 회사의 비즈니스 규칙을 이해하고, 다단계 워크플로우를 실행하며, 그 결과물이 원래의 요구사항을 충족하는지 검증하도록 훈련시키는 방법을 탐구하고 있습니다.
이 연구를 가속화하기 위해, 우리는 이러한 워크플로우를 가장 잘 이해하는 소수의 소프트웨어 회사와 직접 파트너십을 맺고 있습니다. 함께 우리는 도전적이고 가치가 높은 작업을 식별하고 이를 모델의 훈련 및 평가를 위한 연구 문제로 전환하며, 궁극적으로 우리의 모델이 실제 비즈니스 애플리케이션에서 더욱 유능하고 유용하도록 만들고 있습니다.
첫 번째 파트너는 AI 계약 분야의 선두 주자인 Ironclad입니다. Ironclad 팀과 긴밀하게 협력하여, 우리는 에이전트가 계약서 구성, 승인 절차, 재사용 가능한 법률 용어 등을 처리해야 하는 작업을 개발했으며, 이러한 복잡한 워크플로우에서 진전을 보여주었습니다. Ironclad의 전문 지식은 성공이 무엇을 의미하는지 정의하고 실제 고객 요구사항을 최첨단 모델 개발에 직접 반영하는 데 결정적인 역할을 했습니다. 저희는 그들의 파트너십에 감사드리며 함께 이룬 성과를 공유하게 되어 기대가 큽니다.
GPT-6 Astra는 Ironclad 작업을 기반으로 훈련된 최초의 최첨단 모델입니다. 우리의 연구 평가 결과, 평균 점수는 GPT-5.6 Sol보다 32% 높았고, 시도당 예상 시간은 48% 낮았습니다.¹
계약 워크플로우를 훈련 작업으로 전환하기
소프트웨어 구매 프로세스를 설정하는 법무 운영팀을 가정해 봅시다. 재무 부서에서는 특정 금액 이상의 구매를 승인해야 할 수 있고, 보안 부서에서는 특정 요청을 검토해야 할 수 있으며, 법무팀에서는 비표준 약관을 검토해야 할 수 있습니다. 이 프로세스를 설정하는 사람은 그 짧은 목록을 인테이크 양식(intake form), 문서 템플릿, 승인 규칙, 그리고 최종 계약 기록으로 만들어야 합니다.
동일한 작업을 수행하는 AI 에이전트는 소프트웨어 전반에 걸쳐 이러한 요구 사항들을 염두에 두어야 합니다. 예를 들어, 지출 임계값 이상의 재무 부서 승인을 구성하고, 그 위아래 요청들이 올바른 경로를 따르는지 확인해야 합니다. 개별 단계를 정확하게 수행하는 것만으로는 충분하지 않습니다. 완성된 프로세스는 설계된 상황 전반에 걸쳐 작동해야 합니다.
OpenAI에서 Ironclad 직원들과 Ironclad를 사용하는 사람들이 우리 연구원들에게 법률, 상업, 조달 업무 전반에 걸친 11가지 작업을 식별하도록 도왔습니다. 여기에는 기밀유지계약(NDA) 설정, 구매 승인 프로세스 생성, 그리고 요청자가 선택한 관할권(jurisdiction)을 반영하도록 재사용 가능한 법적 조항 업데이트와 같은 작업이 포함되었습니다. 저희는 이 작업들이 숙련된 사용자에게 평균적으로 작업당 30분에서 40분이 소요될 것으로 추정합니다.
저희는 각 작업을 복잡성에 따라 8개에서 50개의 기준에 맞춰 평가했습니다. 이를 통해 모델이 어떤 부분을 정확하게 수행했고 어디서 부족했는지 확인할 수 있었습니다. Ironclad는 또한 모델들이 이러한 작업을 연습할 수 있는 제품의 호스팅 소프트웨어 환경을 제공했습니다. 저희 연구원들은 대표적인 워크플로우를 중심으로 합성 훈련 작업(synthetic training tasks)2을 개발하고, 강화학습(RL)을 사용하여 모델이 연습과 피드백을 통해 개선되도록 했습니다. 이 조합—업무 전문가가 선정한 작업, 상세한 기준, 그리고 모델이 연습할 수 있는 공간—은 고객에게 가장 중요한 실제 업무를 개선하도록 보장합니다.
Astra의 성능
Astra의 성능
각 모델이 가장 높은 점수를 기록한 설정인 Astra는 Max reasoning을, Sol은 High reasoning을 사용하여 비교했습니다. 11가지 연구 과제 전반에 걸쳐 Astra의 평균 점수는 55.0%였으며, GPT-5.6 Sol의 41.6%와 비교되었습니다. 또한 시도당 예상 평균 시간은 Sol의 37.0분에서 Astra의 19.2분으로 감소했습니다. ${3}$ Astra 개발에 사용된 내부 모델은 이 과제들에서 무려 63.7%라는 더 높은 점수를 달성했으며, 저희는 이러한 추가적인 개선을 향후 모델에 적용하는 것을 목표로 하고 있습니다.
| Metric | GPT-5.6 Sol High reasoning | GPT-6 Astra Max reasoning |
|---|---|---|
| Mean rubric score | 41.6% | 55.0% |
| Estimated average time per attempt | 37.0 minutes | 19.2 minutes |
Astra는 더 적은 시뮬레이션 시간으로 더 많은 과제 요구 사항을 충족했습니다. 아래 두 클립은 모델들이 동일한 연구 과제를 처리하는 방식을 보여줍니다. Astra(첫 번째)는 예상 20분 만에 과제 기준의 약 94%를 충족했으며, GPT-5.6 Sol(두 번째)은 예상 32분 만에 약 85%를 충족했습니다.
[IMG:N] Astra가 예상 20분 만에 과제 기준의 약 94%를 충족했습니다.
[IMG:N] GPT-5.6 Sol이 예상 32분 만에 과제 기준의 약 85%를 충족했습니다.
Ironclad에게 이 협업이 의미하는 바
이 연구에서 Ironclad의 역할은 고객들이 잘 알고 있는 어려움을 반영합니다. 즉, 계약 프로세스는 비즈니스가 의존하는 규칙을 유지하면서 예외 사항을 처리해야 한다는 것입니다. 만약 에이전트가 과제 중간에 그 규칙 중 하나를 놓치게 된다면, 이는 소프트웨어 회사가 자신 있게 요청할 수 있는 범위에 제한을 둡니다. 이 점은 에이전트들이 복잡한 계약 과제에서 더 능숙해짐에도 불구하고 인간의 감독이 여전히 중요하다는 것과, 완전한 계약 플랫폼이 필수적임을 강조합니다. 저희 연구원들과 협력하는 것은 Ironclad에게 이러한 문제들을 근본적인 모델 개발 과정으로 가져와 함께 연구할 수 있는 방법을 제공합니다.
모델들이 더욱 능숙해짐에 따라, Ironclad는 이러한 모델들을 자체 제품의 더 많은 영역에서 활용할 기회를 갖게 됩니다. 법무팀과 비즈니스팀에게 이는 AI가 복잡한 계약 체결 과정에 필요한 노력 중 더 많은 부분을 맡으면서도 해당 팀이 의존하는 통제 장치(controls)를 유지할 수 있음을 의미할 수 있습니다.
“AI가 계약의 복잡한 영역에서 진정으로 유용하기 위해서는 개별적인 행동만 완료하는 것을 넘어설 수 있어야 합니다. 에이전트들은 비즈니스 워크플로우가 어떻게 연결되는지, 그리고 팀이 의존하는 통제 장치를 유지하는 것까지 포함하여 전체 계약 라이프사이클(contracting lifecycle)을 이해해야 합니다. OpenAI와의 협력은 이러한 실제 세계의 과제들을 연구 과정으로 가져와 기술 발전을 돕고 있습니다.”
—Sunita Verma, Ironclad 최고기술책임자(Chief Technology Officer)
복잡한 전문 업무를 위한 AI 발전에 함께 참여하세요
저희는 오늘날의 에이전트들이 여전히 신뢰성 있게 완료할 수 없는 중요한 전문 작업들에 대해 저희 연구 및 엔지니어링 팀과 직접 협력할 소수의 소프트웨어 회사들을 초대하고 있습니다. 귀하의 팀이 그러한 사례를 가지고 있다면, 구체적인 예시를 보여주시길 바랍니다. 즉, 에이전트에게 무엇을 요청하는지, 어디서 실패했는지에 대한 증거, 그리고 성공적인 결과를 어떻게 판단할 것인지가 필요합니다. 파트너들은 또한 해당 업무를 깊이 이해하는 인력, 테스트를 위한 안전한 환경, 그리고 연구에 안전하게 사용할 수 있는 데이터를 가져올 수 있어야 합니다. 이는 저희가 실패 지점을 조사하고 모델 개선 여부를 측정하기 위한 출발점이 됩니다.
이러한 결과는 Ironclad의 모든 워크플로우가 아닌 11가지 연구 과제를 다루고 있습니다. 제시된 시간은 실제 고객 시간 절약액을 측정한 것이 아니라, 가정된 모델 처리 및 생성 속도를 기반으로 한 시뮬레이션 추정치입니다.
2
저희는 SEC의 EDGAR 데이터베이스에서 공개적으로 이용 가능한 계약서들을 필터링하여 개인 정보를 제거한 후 시뮬레이션 과제를 만들었습니다. 훈련 또는 평가를 위해 OpenAI 고객 데이터, OpenAI 내부 계약서, 비공개 Ironclad 고객 데이터나 계약서는 사용하지 않았습니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 OpenAI News의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기