Agents-A1 GGUF, 35B 에이전트 추론 능력을 로컬 하드웨어로 가져오다
요약
InternScience가 개발한 35B MoE 에이전트 모델인 Agents-A1 GGUF를 소개합니다. 이 모델은 3단계 학습 패러다임을 통해 장기 추론 및 복잡한 도구 통합 능력을 갖추었으며, GGUF 양자화를 통해 소비자용 하드웨어에서도 효율적인 로컬 배포가 가능합니다.
핵심 포인트
- 35B MoE 구조로 장기 추론 및 다중 도메인 작업 수행
- GGUF 양자화 지원으로 로컬 하드웨어 배포 최적화
- 웹 검색, 과학 연구, 복잡한 지시 이행에 특화된 에이전트 모델
- 262K 컨텍스트 창 및 주요 추론 프레임워크 호환
개요 (Overview)
Agents-A1-Q4_K_M-GGUF는 InternScience가 개발한 35B 파라미터 Mixture-of-Experts (MoE) 에이전트 모델로, 장기 추론 (long-horizon reasoning) 작업에서 조 단위 파라미터 규모의 성능을 달성합니다. 이 모델은 전체 도메인 지도 미세 조정 (full-domain supervised fine-tuning), 도메인 수준의 교사 모델 (teacher models), 그리고 다중 교사 다중 도메인 온-정책 증류 (multi-teacher multi-domain on-policy distillation)를 결합한 3단계 학습 패러다임을 사용하여 6개의 이질적인 도메인(장기 검색, 엔지니어링, 과학 연구, 지시 이행, 일반 에이전트 작업, 과학 에이전트 작업)을 하나의 배포 가능한 시스템으로 통합합니다. 평균 45K 토큰 길이를 갖는 궤적 (trajectories)을 구축하는 도메인 기반 지식-행동 인프라를 바탕으로 구축되었으며, 262K 토큰 컨텍스트 창 (context window)을 지원하고 Hugging Face Transformers, vLLM, SGLang 추론 프레임워크와 호환됩니다. GGUF 변형은 양자화된 추론 (quantized inference)을 가능하게 하여, 추론 집약적인 워크플로 전반에서 강력한 성능을 유지하면서도 소비자용 하드웨어에 배포할 수 있게 합니다. 이 모델을 사용하기 전에 알아야 할 가장 중요한 점은, 이 모델이 복잡한 다단계 작업을 분해하고, 미리 계획하며, 중간 결과에 따라 전략을 조정하는 데 탁월하다는 것입니다. 즉, 이 모델은 범용 채팅 모델이라기보다 근본적으로 에이전트 지향적 (agent-oriented) 모델입니다.
최적의 사용 사례 (Best use cases)
장기 웹 검색 및 연구 합성 (Long-horizon web search and research synthesis). 이 모델은 BrowseComp (75.51), XBench-DS-2510 (86.0), GAIA (96.04), SEAL-0 (56.36) 벤치마크에서 최상위권에 위치합니다. 연구 목표를 실행 가능한 검색 단계로 분해하고, 검색된 정보를 평가하며, 여러 소스에 걸쳐 조사 내용을 합성하는 데 탁월합니다. 단순한 키워드 매칭이나 단일 쿼리 응답이 아니라, 에이전트가 자율적으로 다단계 정보 검색 워크플로를 계획하고 실행해야 할 때 이 모델을 사용하십시오.
도구 통합을 통한 과학 및 공학 문제 해결. 이 모델은 FrontierScience-Olympiad (79.0), FrontierScience-Research (40.0), 그리고 SciCode (44.33)에서 최첨단 (state-of-the-art) 결과를 달성했습니다. 모델은 함수 호출 (function calling) 및 도구 통합 (tool integration)을 네이티브로 지원하여, 코드 인터프리터 (code interpreter), 과학 데이터베이스, 그리고 계산 도구와의 상호작용이 필요한 작업에 적합합니다. 워크플로에 코드 작성 및 실행, 과학 API 호출, 또는 물리, 화학, 수학 문제를 해결하기 위한 여러 전문 도구의 오케스트레이션 (orchestration)이 포함되는 경우 이 모델을 배포하십시오.
대규모 다중 제약 조건 지시 이행. IFBench (80.61) 및 IFEval (94.82) 성능을 바탕으로, 이 모델은 여러 상충하는 제약 조건이 포함된 상세하고 복잡한 지시 사항을 안정적으로 따릅니다. 엄격한 서식 요구 사항이 있는 문서 생성, 정밀한 규칙 세트가 적용된 데이터 변환, 또는 출력이 열거된 제약 조건 세트를 반드시 충족해야 하는 품질 보증 (quality assurance) 프로세스와 같은 작업에 사용하십시오. 이 모델의 지시 이행 (instruction-following) 능력은 이질적인 에이전트적 행동 (heterogeneous agentic behaviors)에 대한 특화된 학습 덕분에 많은 더 큰 모델들을 능가합니다.
모바일 및 데스크톱 자동화 에이전트. 주요 초점은 아니지만, 모델의 도구 사용 (tool-use) 능력과 순차적 행동에 대한 추론 능력은 그래픽 사용자 인터페이스 (GUI), 자동화 프레임워크, 그리고 API 체인과 상호작용하는 에이전트를 구축하는 데 적합하게 만듭니다. 네이티브 함수 호출 (function-calling) 지원은 에이전트 오케스트레이션 프레임워크와의 원활한 통합을 가능하게 하여, 데이터 입력, 보고서 생성, 또는 애플리케이션 간 작업 완료와 같은 워크플로를 자율적으로 실행할 수 있도록 합니다.
재료 및 분자 결합 예측 (Material and molecular binding prediction). 이 모델은 MolBench-bind에서 56.8을 달성하며, 유사한 35B 모델들을 크게 능가합니다. 모델의 과학적 추론 (scientific reasoning) 능력은 도구 통합 (tool integration)과 결합되어, 도메인에 기반한 화학 또는 재료 과학 계산, 분자 특성 예측, 그리고 물리적 또는 화학적 시스템에 대한 구조적 추론 (structured reasoning)이 필요한 작업에 효과적입니다.
한계점 (Limitations)
전체 컨텍스트에서의 추론 속도 및 리소스 요구 사항. 262K의 컨텍스트 윈도우 (context window)를 통해 긴 문서를 처리할 수 있지만, 최대 컨텍스트에서 완전한 처리량 (throughput)을 달성하려면 상당한 하드웨어가 필요합니다. 실용적인 지연 시간 (latency)을 위해서는 여러 GPU에 걸친 텐서 병렬화 (tensor parallelism)를 강력히 권장합니다. Q4_K_M 양자화 (quantization)는 메모리 점유율 (memory footprint)을 줄여주지만, 전체 정밀도 (full-precision) 추론과 비교했을 때 미세한 품질 저하를 초래합니다. 단일 GPU 배포의 경우 100K 이상의 토큰 입력에서 상당한 지연 시간을 경험하게 됩니다.
프런티어 규모 벤치마크에서의 성능 격차. 강력한 결과에도 불구하고, 이 모델은 여러 벤치마크에서 GPT-5.5 및 DeepSeek-V4-pro와 같은 전문화된 프런티어 모델 (frontier models)에 뒤처집니다. BrowseComp (75.51 대 84.4), SciCode (44.33 대 56.1), 그리고 MLE-Lite (43.94 대 72.73)에서 그 격차는 유의미합니다. 만약 이러한 특정 도메인에서 절대적인 최대 성능이 요구된다면, 더 큰 규모의 독점 모델 (proprietary models)이 여전히 필요합니다.
35B 규모에서의 엔지니어링 작업 성능. MLE-Lite (43.94) 및 SciCode (44.33) 결과는 이 모델이 장기적 탐색 (long-horizon search) 작업에 비해 복잡한 코드 생성 (code generation) 및 수학적 추론 (mathematical reasoning)에서 더 어려움을 겪는다는 것을 나타냅니다. 35B 클래스 내에서는 경쟁력이 있지만, 이 모델은 순수 코드 완성 (code completion)이나 알고리즘 문제 해결 (algorithmic problem-solving)에 최적화되어 있지 않습니다. 이러한 작업에는 전문화된 코드 모델을 사용하십시오.
실질적인 배포 고려 사항을 포함한 Apache 2.0 라이선스. 이 모델은 Apache 2.0 라이선스 하에 오픈 소스로 제공되어 상업적 이용이 가능하지만, 배포 비용(GPU 인프라, 모니터링, 스케일링)은 여전히 상당합니다. 이 모델은 프로덕션 서빙 (production serving)을 위해 vLLM 또는 SGLang이 필요하며, 이는 단순한 API 호출을 넘어 운영 복잡성을 추가합니다.
기본 형태에서는 시각 기능(vision capabilities)을 지원하지 않음. 텍스트 전용 언어 모델 변형(vLLM에서 --language-model-only 플래그 사용)은 시각 인코딩 (vision encoding) 기능을 제외합니다. 멀티모달 (multimodal) 입력 처리가 필요한 경우, 시각 인코더를 포함한 전체 모델을 사용해야 하며, 이는 메모리 요구 사항과 추론 지연 시간 (inference latency)을 증가시킵니다.
훈련 데이터 구성 미공개. README에는 베이스 모델 (base model), 사전 학습 데이터셋 (pretraining dataset), 또는 지도 미세 조정 (supervised fine-tuning) 데이터의 정확한 구성이 명시되어 있지 않습니다. 이는 훈련 문서가 완전히 투명한 모델들과 비교했을 때, 잠재적 편향 (biases), 라이선스 충돌, 또는 도메인 커버리지 격차를 평가하는 능력을 제한합니다.
비교 분석
Agents-A1은 이 GGUF 양자화 (quantization)가 파생된 베이스 모델입니다. 주요 차이점은 낮은 메모리로 추론이 가능하도록 하는 양자화 형식입니다. 소비자용 GPU에서 로컬 배포를 하려면 이 GGUF 변형을 선택하십시오. 충분한 VRAM이 있고 최대 품질이 필요한 경우에만 전체 정밀도 (full-precision) 베이스 모델을 사용하십시오.
DeepSeek-V3는 절대적인 벤치마크에서 Agents-A1보다 뛰어난 성능을 보이는 더 큰 프론티어 모델 (frontier model)이지만, 훨씬 더 많은 컴퓨팅 자원을 요구하며 폐쇄 소스 (closed-source) 제한이 있습니다. 가능한 최고 수준의 성능이 필요하고 독점 API (proprietary APIs)를 사용할 수 있다면 DeepSeek-V3를 선택하십시오. 에이전트 작업 (agentic tasks)에서 경쟁력 있는 결과를 내면서 로컬 오픈 소스 배포가 필요하다면 Agents-A1을 선택하십시오.
Holo-3.1-35B-A3B는 일반적인 장기 추론 (long-horizon reasoning)보다는 컴퓨터 사용 에이전트 (computer use agents) 및 UI 그라운딩 (UI grounding)에 최적화된 특화된 시각-언어 모델 (vision-language model)입니다. 주요 작업이 시각적 탐색 (visual navigation), 스크린샷 이해 (screenshot understanding), 또는 모바일 자동화 (mobile automation)라면 Holo-3.1을 사용하십시오. 시각적 그라운딩 (visual grounding) 요구 사항 없이 텍스트, 코드 및 도구 상호작용 (tool interactions)에 대한 추론이 필요하다면 Agents-A1을 사용하십시오.
GigaChat3-10B-A1.8B는 실질적으로 더 작으며 (10B 파라미터), 러시아어 및 로컬 배포 효율성에 최적화되어 있습니다. 러시아어 작업이나 GPU 메모리가 극도로 제한적인 상황에서는 GigaChat3를 선택하십시오. 추가적인 파라미터와 학습을 통해 우수한 추론 성능을 발휘하는 영어 기반 에이전트 작업 (agentic tasks)에는 Agents-A1을 선택하십시오.
AgentLM-70B는 Llama-2를 기반으로 구축되었으며 상호작용 궤적 (interaction trajectories) 전반에 걸친 에이전트 지시어 튜닝 (agent instruction tuning)에 집중하지만, Agents-A1을 차별화하는 멀티 티처 증류 (multi-teacher distillation) 및 이질성 인식 학습 (heterogeneity-aware training)이 부족합니다. AgentLM-70B는 더 많은 파라미터 수를 제공하지만 더 많은 컴퓨팅 자원을 필요로 합니다. 반면 Agents-A1은 더 효율적인 35B 파라미터 예산 내에서 더욱 정교한 학습 방법론을 통해 벤치마크 작업에서 더 나은 성능을 달성합니다.
기술 사양 (Technical specifications)
아키텍처 및 파라미터 (Architecture and parameters): 네이티브 함수 호출 (function-calling) 지원 및 Qwen3 호환 추론 파서 (reasoning parser)를 통한 추론 파싱 (reasoning parsing) 기능을 갖춘 Llama 기반 아키텍처로 구축된 35B Mixture-of-Experts 모델입니다.
학습 데이터 및 방법론 (Training data and methodology): 평균 길이 45K 토큰의 궤적 (trajectories)을 생성하는 도메인 기반 지식-행동 인프라 (domain-grounded knowledge-action infrastructure)에서 학습되었습니다. 3단계 학습 과정: (1) 6개 도메인에 걸친 전체 도메인 지도 미세 조정 (full-domain supervised fine-tuning), (2) 도메인 수준의 티처 모델 (teacher model) 학습, (3) 두드러진 어휘 정렬 (salient vocabulary alignment) 및 이질성 인식 최적화 (heterogeneity-aware optimization)를 포함한 멀티 티처 멀티 도메인 온-폴리시 증류 (multi-teacher multi-domain on-policy distillation).
컨텍스트 윈도우 (Context window): 최대 컨텍스트 길이 262,144 토큰.
지원 프레임워크 (Supported frameworks): Hugging Face Transformers, vLLM 및 SGLang 추론 엔진과 호환됩니다.
양자화 (Quantization): Q4_K_M GGUF 양자화 형식이 제공됩니다. 베이스 모델 변형(base model variant)에서는 전체 정밀도(full-precision) 가중치를 사용할 수 있습니다.
추론 요구 사항 (Inference requirements):
-
표준 배포: 262K 컨텍스트(context)를 지원하는 GPU 1개
-
권장 정적 메모리 비율 (Recommended static memory fraction): 0.8 (vLLM/SGLang)
-
텐서 병렬화 (Tensor parallelism): 멀티 GPU 서빙을 위한
--tp-size파라미터를 통해 지원됨 -
도구 사용 모드 (Tool-use mode):
--tool-call-parser qwen3_coder플래그가 필요함 -
텍스트 전용 모드 (Text-only mode): 비전 인코더(vision encoder)를 건너뛰고 KV 캐시(KV cache) 메모리를 확보하려면
--language-model-only를 지정
권장 샘플링 파라미터 (Recommended sampling parameters): Temperature 0.85, top_p 0.95, top_k 20, min_p 0.0, presence_penalty 1.1, repetition_penalty 1.0.
모델 입출력 (Model inputs and outputs)
입력 (Inputs)
텍스트 프롬프트 (Text prompts): 임의의 영어 텍스트 지침, 질의 및 작업 설명
컨텍스트 창 (Context window): 최대 262,144 토큰의 입력 컨텍스트
도구 정의 (Tool definitions): 도구 호출(tool-calling) 모드를 위한 함수/API 사양 (Qwen3-coder 파서와 호환되는 JSON 스키마 형식)
추론 파싱 (Reasoning parsing): 확장된 추론 모드를 위해 Qwen3와 호환되는 추론 토큰(reasoning token) 구조를 지원
출력 (Outputs)
텍스트 생성 (Text generation): 입력 지침을 따르는 자기회귀(Autoregressive) 토큰 시퀀스
도구 호출 (Tool calls): JSON 형식의 구조화된 함수 호출 (tool-call-parser가 활성화된 경우)
다회차 추론 (Multi-turn reasoning): 중간 단계 및 자기 수정(self-corrections)을 포함한 확장된 추론 흔적(reasoning traces)
궤적 형식 (Trajectory format): 다운스트림 평가 및 작업 실행에 적합한 에이전트 행동-관찰(action-observation) 쌍
시작하기 (Getting started)
SGLang 사용하기:
# Install SGLang
# uv pip install sglang
# Start server with tool-use support
...
vLLM 사용하기:
from vllm import LLM, SamplingParams
# Load model with tool-use and reasoning support
llm = LLM(
...
자주 묻는 질문 (Frequently asked questions)
Q: 이 모델을 상업적으로 사용할 수 있나요?
A: 네, Agents-A1은 상업적 이용, 수정 및 재배포를 허용하는 Apache 2.0 라이선스 하에 출시되었습니다. 모델을 수정할 경우 라이선스 사본을 포함해야 하며 변경 사항 목록을 제공해야 합니다.
Q: 이 모델을 실행하려면 어떤 GPU 하드웨어가 필요한가요?
A: 262K 컨텍스트 (context)에서 단일 GPU 배포를 수행하려면 A100 (80GB), H100 또는 그에 상응하는 GPU를 권장합니다. Q4_K_M GGUF 양자화 (quantization)는 전체 정밀도 (full precision) 대비 메모리 요구 사항을 줄여줍니다. 긴 컨텍스트에서의 운영 환경 지연 시간 (production latency)을 줄이기 위해서는 멀티 GPU 텐서 병렬화 (multi-GPU tensor parallelism, vLLM의 --tp-size 파라미터 사용)를 권장합니다.
Q: 과학적 추론 (scientific reasoning) 작업에서 Agents-A1은 DeepSeek-V4-pro와 비교했을 때 어떠한가요?
A: FrontierScience-Research 벤치마크에서 Agents-A1은 40.0을 기록하여 DeepSeek-V4-pro의 17.9를 상회하며, 우수한 전문 과학 추론 능력을 입증했습니다. SciCode에서는 DeepSeek-V4-pro가 앞서고 있습니다 (56.1 대 44.33). 올림피아드 스타일의 과학 문제에는 Agents-A1을 선택하고, 과학적 맥락에서의 순수 코드 생성 (code generation)에는 DeepSeek-V4-pro를 선택하십시오.
Q: 이 모델의 알려진 실패 모드 (failure modes)는 무엇인가요?
A: 이 모델은 전문 코드 모델과 비교했을 때 순수 코드 생성 및 수학적 문제 해결 능력에서 성능이 낮습니다 (MLE-Lite: 43.94 대 프런티어 모델 72.73). 또한 프런티어 모델들이 더 큰 규모를 가진 일부 장기 탐색 (long-horizon search) 작업에서도 뒤처집니다 (BrowseComp: 75.51 대 GPT-5.5의 84.4). 실제 성능은 도구 가용성 (tool availability) 및 작업 분해 (task decomposition) 전략에 크게 좌우됩니다.
Q: 이 모델을 미세 조정 (fine-tune)할 수 있나요?
A: 네, 이 모델은 미세 조정을 위해 Hugging Face Transformers와 호환됩니다. README에는 Transformers 이외의 지원되는 미세 조정 프레임워크가 명시되어 있지 않으나, LoRA 및 QLoRA와 같은 기술은 작동할 것입니다. 기본 저장소(base repository)에는 공식적인 미세 조정 예시가 제공되지 않습니다.
Q: 도구 호출 (tool-calling) 모드는 어떤 입력 형식을 기대하나요?
AI 자동 생성 콘텐츠
본 콘텐츠는 Hacker Noon AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기