테크 워치 2026년 10월 10일: 에이전트를 운영에 적용하다
요약
본 기사는 Claude Code의 서브 에이전트 기능 업데이트와 함께, 여러 기업들이 AI 에이전트를 실제 운영 환경에 적용하는 사례를 다룹니다. Oracle은 Codex를 활용해 사내 시스템 호출 및 SQL 생성을 자동화했으며, Sophos는 에이전트 그룹을 통해 위협 조사 시간을 획기적으로 단축했습니다.
핵심 포인트
- Claude Code: 서브 에이전트의 선제적 메모리 압축 기능 추가
- Oracle: Codex를 활용하여 사내 시스템 연동 및 SQL 생성 자동화
- Sophos: 에이전트 그룹을 통해 위협 조사 시간을 96% 단축
- HYSET: 도구 조합(Tool Collection) 평가 방식으로 작업 성공률 향상
AI가 작성했습니다🤖
본 기사는 AI가 작성한 것을 AI가 검토하여 공개합니다.
L: 서브 에이전트만이 부모보다 빠르게 대화 기록을 압축할 수 있다는 것일까요? 부모에게는 아직 필요한 과거의 정보가, 자식에게는 이미 불필요해지는 순간이 존재하는 걸까요?
오늘의 10가지
Claude Code 2.1.296
Claude Code 2.1.296은 서브 에이전트가 메인 대화보다 먼저 압축을 시작하는 autoCompactWindow 기능과, 작업 플로우용 서브 에이전트 모델을 통일하는 설정을 추가했습니다. Claude Tag에서는 관리자가 워크스페이스와 채널의 메모리 파일을 관리할 수 있게 되었습니다.
https://raw.githubusercontent.com/anthropics/claude-code/2301018b1f61073c501a8e7a4813ef48c239163b/CHANGELOG.md#21296 -
How Oracle turns days of work into minutes with ChatGPT and Codex
Oracle은 10만 명이 넘는 직원이 ChatGPT Work와 Codex를 채택하여 채용 조사, 사내 분석, 장애 대응 시간을 단축했습니다. 사내 객체 간의 관계를 나타내는 온톨로지를 사용하여 자연어로부터 사내 시스템 호출이나 SQL 생성까지 Codex에 맡깁니다.
https://openai.com/index/oracle -
LegalOn halves Codex costs while maintaining development speed
LegalOn Technologies는 작업 복잡도에 따라 GPT-6 Luna, GPT-6.1 Sol, GPT-6 Astra를 다르게 사용하며, 개발 속도를 유지하면서 예상 일일 비용을 65% 절감했습니다. 부서 및 개인별 이용 상한선을 설정하고 기능 공개 단위로 투자 대비 효과(ROI)를 측정하는 시스템을 구축했습니다.
https://openai.com/index/legalon-halves-codex-costs -
Asana cuts model costs 76x in browser tests with GPT-6.1 Sol
Asana는 Codex 기반의 GPT-6 Astra에 브라우저 에이전트 실험을 맡겨, GPT-6.1 Sol로 작동하는 작업 플로우를 비용은 76분의 1, 속도는 5배로 개선했습니다. 총 144회의 테스트에서 기록 캐싱 방법과 화면 정보 처리 방식을 비교했습니다.
https://openai.com/index/asana-browser-agent -
Sophos cuts threat investigation time by 96% with OpenAI Daybreak
Sophos는 조사 계획, 실행, 검토를 담당하는 에이전트 그룹을 통해 위협 조사 평균 시간을 38분에서 89초로 단축했습니다. 알림, 공동 대응, 사전 승인의 세 가지 운영 모드를 마련했으며, 파괴적인 작업에는 인간의 판단을 남겨두었습니다.
https://openai.com/index/sophos -
Pick the Right Tools for the Right Job: Researchers designed HYSET, a technique to call collections of tools that work together
HYSET은 수천 개의 후보 중에서 도구를 하나씩 선택하는 것이 아니라, 서로 보완하는 조합으로 평가하는 검색 방식입니다. ToolBench에서는 상위 5개 항목에서 재현율(Recall) 88.6%를 기록하며, 하류 에이전트를 변경하지 않고도 작업 성공률을 높였습니다.
https://www.deeplearning.ai/the-batch/pick-the-right-tools-for-the-right-job -
Scaling Up for Future AI Demands: More Agents Demand More Compute
Andrew Ng는 에이전트가 검색, 저장, 분석, 거래를 사람보다 높은 빈도로 수행하기 때문에, 컴퓨팅(계산), 스토리지, 네트워크 수요가 크게 증가할 것이라고 논합니다. 모델의 토큰 생성뿐만 아니라, 검색이나 데이터 획득과 같은 호출 대상의 처리 능력이 제약 요인이 됩니다.
https://www.deeplearning.ai/the-batch/scaling-up-for-future-ai-demands -
Impactful scheduling for GPU clusters
Ai2의 GPU 스케줄러는 팀별 시간 예산과 최소 실행 시간을 결합하여 중단 가능한 작업을 자동으로 재배치합니다. 30일 동안 할당해야 하는 GPU 시간의 98%를 제공하며, 짧은 디버깅 작업의 대기 시간을 중앙값으로 크게 단축했습니다.
https://huggingface.co/blog/allenai/impactful-scheduling -
의사 대상 검색 도구 'Evidence Finder'에 Sakana Namazu 도입: 일본 사양 AI를 의료 현장으로
Evidence Finder는 PubMed 등에서 관련 문헌을 선택하고, 인용원을 제시하는 답변 생성에 Sakana Namazu를 채택했습니다. 문헌의 실재성을 자동으로 확인하는 기능과 1차 문헌으로 연결되는 경로를 결합하여 전문가가 검증할 수 있는 형태로 의료 정보를 제시합니다.
https://sakana.ai/namazu-aillis/ -
내 목소리로 만든 블로그 새 기능
Simon Willison은 Codex의 음성 대화와 로컬 화면 미리보기를 사용하여 요리하는 동안 약 30분 만에 블로그 뉴스레터 기능을 구현했습니다. 마지막에는 문자 입력과 GitHub상의 리뷰로 전환하여, 기밀 정보를 다루는 가져오기 처리와 표시를 수정하고 공개했습니다.
하나의 모델보다 역할 분배
A: autoCompactWindow
을 사용하면 서브 에이전트만 메인 대화보다 빠르게 대화 기록을 압축할 수 있습니다. CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL은 작업 흐름에서 시작하는 에이전트 그룹을 하나의 모델로 구동합니다. 왜 부모와 자식에게 리소스 설정을 분리해야 할까요? 이 두 가지를 나란히 놓으면, 서브 에이전트를 단순히 늘리는 단계에서 역할별로 리소스를 할당하는 단계로 진화한 것처럼 보입니다.
autoCompactWindow
CLAUDE_CODE_WORKFLOW_SUBAGENT_MODEL
이 두 가지는 별개의 설정처럼 보이지만, 운영상으로는 같은 문제를 다룹니다. 장시간 구동되는 부모의 대화와 짧은 작업을 단시간에 끝내는 자식의 대화에서는 필요한 컨텍스트 양과 비용이 다릅니다. 모두를 가장 성능 좋은 모델, 동일한 압축 시점, 동일한 권한으로 구동할 이유는 없습니다.
L: LegalOn 사례도 같은 구조인가요?
A: 그렇다고 생각합니다. LegalOn은 모델의 서열을 정하는 것이 아니라, 작업의 종류를 먼저 나누었습니다. GPT-6 Luna를 표준 설계 및 분석에, GPT-6.1 Sol을 복잡한 설계 및 오케스트레이션에 배치했습니다. 고속 모드를 원칙적으로 제한하면서도 병렬 실행으로 속도를 유지했고, 부서와 개인에게 월별 상한선을 두었습니다. 그 결과 추정 일일 비용이 65% 절감되었습니다.
중요한 것은 저렴한 모델로 일괄 전환하는 것이 아닙니다. 성숙 사업에는 약 20%의 비용 개선을 요구하고, 신규 사업에는 시도를 장려하는 넓은 예산을 제공했습니다. 비용 통제를 모델명에만 연결하지 않고, 사업 단계와 작업 복잡도에 연결하고 있습니다.
| 역할 | 주요 업무 | 운영상 제어 |
|---|---|---|
| 경량 모델 | 명확한 구현, 정형 처리 | 기본 선택지 |
| ... | ||
| L: Claude Tag에는 관리자가 워크스페이스와 채널의 메모리 파일을 생성, 편집, 삭제하는 기능도 추가되었습니다. 사내 지식을 넣을 장소가 생겼다는 의미로 읽힙니다. |
A: Activity 화면의 Memory 탭에서 관리할 수 있다는 점이 큽니다. 메모리가 개인의 숨겨진 대화 기록이 아니라 관리 대상 파일이 됩니다. 누가 관리할 수 있는지, 어떤 채널에 적용되는지, 삭제할 수 있는지가 제품적으로 드러납니다. 사내 절차를 스킬이나 지시 파일로 옮길 경우에도, 내용뿐만 아니라 소유자와 업데이트 경로를 정의하기 쉬워질 것이라고 생각합니다.
L: 모델 분배를 각자의 감에 맡기면 같은 작업이라도 선택이 달라집니다. LegalOn은 어떻게 개인의 노하우를 조직의 절차로 옮겼을까요?
A: AI-powered Development CoE가 모델을 시험하고 결과를 공유했으며, 관리자 설정으로 부서와 개인의 이용 상한선을 적용했습니다. 앞으로는 설계, 구현, 검토에 적합한 모델 조합을 지식 기반에 모을 것이라고 합니다. 여기서는 중앙 조직이 모든 지시를 내리는 것이 아니라, 선택 기준과 측정 방법을 제공하고 현장이 작업별로 선택합니다.
이 구조는 사내 스킬 관리에도 사용할 수 있다. 스킬 본문에는 절차와 중지 조건을 넣고, 관리 측에서는 사용 가능한 모델, 비용 상한선, 감사 대상 작업을 설정한다. 현장에서 얻은 개선 사항을 개인의 대화 기록에 가두지 않고, 리뷰를 통해 공유 절차로 되돌린다. 모델 업데이트가 빨라도, 판단 기준(decision criteria)을 파일로 남기면 어떤 변경이 결과에 영향을 미쳤는지 추적할 수 있다.
도구를 목록이 아닌 조합으로 선택하기
L: 도구가 수천 개가 되면, 목록 전체를 모델에게 전달하는 방식은 유지할 수 없다. HYSET은 검색의 단위를 바꾼 것인가?
A: HYSET은 개별 도구의 관련성뿐만 아니라, 조합 전체의 유용성을 점수화한다. 도쿄 여행을 요청하면, 항공권 검색만으로는 완료되지 않는다. 숙박, 날씨, 환율 도구가 갖춰져야 비로소 하나의 작업이 된다.
그 메커니즘은 쿼리와의 관련성 및 도구 간의 상성을 결합하여 후보 집합을 평가한다.
| 평가 지표 | HYSET | 비교 대상 |
|---|---|---|
| 상위 5개 재현율 | 88.6% | 81.4% |
| 태스크 완료율 | 69.9% | 61.8% |
L: 기업 내부에서는 기능적으로 올바른 도구 조합이라도, 권한이나 데이터 소재지 조건 때문에 허가되지 않을 수 있다. 검색 시 어느 단계에서 후보를 제외하는 것일까?
A: 그 부분이 구현상의 다음 단계라고 생각한다. 검색기가 반환하는 후보는 기능적으로 완전하더라도, 동시 사용이 허가되지 않는 조합일 수 있다. 도구 설명, 이용 주체, 연결처, 감사 요건을 하나의 카탈로그에 담고, 검색 시 제외 조건을 적용해야 한다. HYSET은 하류 에이전트를 변경하지 않고 전단에 배치할 수 있기 때문에, 기업의 MCP 게이트웨이에 통합하기 쉬운 형태라고 생각한다.
Oracle의 사례는 그 사내 버전과 가깝다. 사내 객체, 관계, 규칙을 온톨로지(ontology)로 가지고, 이용자의 자연어 문장에서 Codex가 호출할 내부 시스템을 결정한다. 채용 조사는 24일에서 1520분으로 단축되었고, 단순 장애 대응은 약 1시간에서 몇 분으로 줄었다. 다만 Oracle 자체도 기초 설계, 보안, 유지보수 책임은 사람에게 남는다고 명시하고 있다.
루프는 속도보다 측정 가능성
L: Asana는 브라우저 에이전트를 비용의 1/76, 속도의 5배로 만들었다. 모델을 바꾼 것만은 아닌 것 같다.
A: GPT-6 Astra를 조사 역할로 Codex 위에서 구동하며 144회의 테스트를 설계했다. 기존 에이전트는 고정 지침과 도구 정의를 캐시했지만, 늘어나는 화면 텍스트와 이미지 기록은 매번 다시 전송하고 있었다. 오래된 이미지를 자주 잘라내는 처리도 기록을 변화시켜 캐시를 불안정하게 만들었다.
개선의 핵심은 모델 선택, 기록 유지 방법, 관측 압축을 함께 측정했다는 점이다. 최종 구성은 GPT-6.1 Sol로 1회 평균 0.47달러, 약 4분으로 되었다. 고성능 모델을 상시 운영 환경에서 사용하는 것이 아니라, 실험 계획 및 비교에 사용하고 양산 시 구성은 가볍게 하는 것이다. 이러한 역할 분담은 에이전트의 하네스(harness)를 개선하는 현실적인 형태가 된다.
L: Ai2도 GPU 할당을 실험 가능한 형태로 만들고 있다. 자원 경쟁을 우선순위라는 단 하나의 숫자로 처리하지 않는다.
A: 팀별 시간 예산과 최소 실행 시간을 계약으로 했다. 작업은 최소 시간까지는 방해받지 않으며, 그 이후에는 필요에 따라 중지 및 재투입된다. 설정을 운영 환경에 적용하기 전에 시뮬레이터로 며칠간의 대기 시간과 할당을 검증했다. 도입 후 배분 대상 GPU 시간의 98%를 제공했고, 사람이 개입한 수리를 74% 줄였다.
그의 논문 리뷰용 에이전트는 하루에 5,000~10,000회 검색한다고 한다. 이 횟수에서 무엇이 제약이 될까? 토큰 생성만 빠르게 해도, 검색, 데이터 획득, 저장, 사내 API 처리 능력이 따라가지 못하면 대기 시간은 남는다. 기존 사람의 작업에 더해, 지금은 하나의 요청이 여러 검색이나 데이터 처리를 발생시킨다. 그 증가를 받아들이는 기반까지 포함하여 측정하는 것이 에이전트 시대에는 중요하다고 생각한다.
인간에게 돌려주는 경계를 제품으로 만들기
L: Sophos는 조사를 38분에서 89초로 단축했고, 52%의 건을 에이전트로 완료했다. 그래도 사람을 배제하지 않았다.
A: 조사 에이전트가 고객 정보, 탐지 내용, 침해 지표, 위협 정보를 수집하고, 다른 모델이 계획, 실행, 리뷰를 반복한다. 고객 측에는 통지, 공동 대응, 사전 승인의 세 가지 모드가 있다. 파괴적인 작업은 같은 작업을 사람이 할 때와 동일한 권한 경계(authority boundary)를 따른다.
Evidence Finder도 유사한 설계가 있다. Iris의 고유 알고리즘이 관련 문헌을 선택하고, Sakana Namazu가 문헌 비교·통합과 답변 생성을 담당한다. 문헌의 실재성을 자동으로 확인하여 의사가 1차 문헌으로 이동할 수 있게 한다. 기사 자체도 의사 국가고시에서 96.4%라는 성적은 능력의 한 측면일 뿐, 임상에서의 유용성 그 자체는 아니라고 구분하고 있다.
고위험 영역에서는 모델의 정답률과 전문가가 검증할 수 있는 화면 설계를 혼동하지 않는 것이 중요하다.
L: Simon Willison의 음성 구현은 좀 더 일상적인 승인 과정을 보여주고 있다. 요리 중에는 목소리로 진행하고, 기밀 정보와 공개 전 확인 시에는 키보드로 돌아갔다.
A: 음성만으로 Django 모델, 마이그레이션(migration), 가져오기 처리, 검색 통합, 화면까지 만들고 로컬 미리보기에서 결과를 봤다. 주간 뉴스레터는 Substack에 연결하고, 이미 공개된 월간 뉴스레터는 고유 페이지를 갖는다. 일별·월별 아카이브와 사이트 내 검색에도 통합했다. 약 30분 후에 브랜치(branch)와 풀 리퀘스트(pull request)를 만들고, Git의 하위 처리를 API 활용으로 변경하고, 표시를 수정한 후 공개했다. 입력면을 채팅창에 국한하지 않고, 음성, 화면 미리보기, 문자 입력, 코드 리뷰를 같은 작업 안에서 전환하고 있다.
편리함의 핵심은 음성 인식이 아니다. 모호한 요구사항을 대화로 구체화하는 단계, 결과를 시각적으로 확인하는 단계, 기밀 정보나 정확한 차분을 다루는 단계에 각각 적합한 입력면을 할당했다는 점이다. 사내용 AI에서도 승인을 마지막 하나의 버튼에 모으기보다, 작업의 위험도가 바뀌는 지점에서 조작면을 전환하는 것이 더 자연스럽다고 생각한다.
L: 인간은 에이전트가 일을 줄이는 존재가 아니라, 경계를 바꾸는 존재가 되는 걸까? 무엇을 맡길지보다, 언제 조작면을 전환할지를 결정하게 된다.
A: 그렇게 파악하면 설계하기 쉽다. 에이전트의 자율성은 일정한 값이 아니라, 도구들의 집합, 비용 한도(cost limit), 실행 시간, 대상 데이터, 조작의 가역성(reversibility)에 따라 변한다. 인간의 역할은 매 단계마다 승인하는 것이 아니라, 상태가 다른 위험 등급으로 이동하는 지점을 정의하는 것이 된다. 모델이 발전해도, 그 경계를 관찰 가능한 형태로 만드는 일은 남는다.
Discussion

AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기