Launch HN: Augento (YC W25) – 강화학습 (Reinforcement Learning)을 통한 에이전트 미세 조정
요약
Augento는 DeepSeek R1의 연구 방식을 채택하여 강화학습(RL) 기반의 에이전트 미세 조정 서비스를 제공하는 YC W25 스타트업입니다. 사용자가 명시적인 데이터셋 대신 보상 함수(Reward function)를 제공하면, 에이전트의 작업에 최적화된 오픈 소스 모델을 학습시켜 성능을 개선합니다.
핵심 포인트
- DeepSeek R1과 유사하게 순수 강화학습(RL)을 활용한 사후 학습(Post-train) 방식 채택
- 방대한 지도 미세 조정(SFT) 데이터셋 없이 보상 함수만으로 모델 최적화 가능
- 코딩 에이전트, MCP 도구 특화, 브라우저 내비게이션 등 다양한 에이전트 활용 사례 지원
- 단 20개의 학습 샘플만으로 코딩 에이전트의 치명적 버그를 40% 감소시킨 사례 보유
안녕하세요 HN, 저희는 Augento (https://augento.ai/)의 공동 창업자들입니다. 저희는 DeepSeek R1과 유사한 미세 조정 (Fine-tuning) 서비스를 구축하고 있습니다. 귀하의 에이전트를 연결하고, 무엇이 맞고 틀린지 저희에게 알려주시면, 해당 에이전트에 최적화된 LLM을 제공해 드립니다. 데모 영상은
에 있으며, 문서(docs)는 https://docs.augento.ai/ 에서 확인하실 수 있습니다. 누구나 https://augento.ai/ 에서 사용 가능합니다.에이전트들은 항상 실패하며, 특히 실제로 유용한 용도로 사용하려고 할 때 더욱 그렇습니다. 현재의 해결 방식들은 형편없습니다. 프롬프팅 (Prompting)은 본질적인 한계가 있으며, 지도 미세 조정 (Supervised Fine-tuning, SFT)은 수집하기 어려운 방대한 명시적 데이터셋을 필요로 합니다.
두 달 전, DeepSeek R1 논문은 (거의) 순수한 강화학습 (Reinforcement Learning, RL)만으로 LLM을 사후 학습 (Post-train)하는 방법을 설명했습니다. 저희는 그들의 연구를 채택하여 이를 기반으로 한 미세 조정 (Fine-tuning) 플랫폼을 구축했습니다.
저희가 귀하의 에이전트 데이터 흐름을 가로챌 수 있도록 허용하면, 저희는 에이전트의 특정 작업에 맞춰 학습된 미세 조정된 오픈 소스 모델을 제공합니다. 명시적인 미세 조정 샘플로 구성된 방대한 데이터셋을 제공하는 대신, 모델의 출력을 판단하는 보상 함수 (Reward function)를 제공하면 됩니다.
다음은 이를 활용할 수 있는 예시입니다:
코딩 에이전트 (Coding Agent): 저희는 지속적으로 구문 오류 (Syntax errors)를 범하고 의미론적 예외 케이스 (Semantic edge cases)를 제대로 처리하지 못하던 코딩 에이전트를 미세 조정했습니다. 컴파일러를 기준으로 코드를 평가하는 보상 함수 (Reward function)를 제공함으로써, 에이전트는 이러한 오류를 생성하지 않도록 학습했습니다. 미세 조정된 모델은 단 20개의 학습 샘플만으로 치명적인 버그를 40% 감소시켰습니다.
MCP 도구 특화 (MCP Tool Specialization): MCP 프로토콜을 사용하는 맞춤형 내부 도구 세트를 가지고 있지만, 에이전트가 계속해서 잘못된 도구를 선택하거나 호환되지 않는 파라미터 (Parameters)를 전달한다고 가정해 보십시오. 도구 선택과 파라미터 매칭을 점수화하는 보상 함수 (Reward function)를 통해 미세 조정할 수 있습니다.
브라우저 에이전트 내비게이션 (Browser Agent Navigation): 만약 복잡한 웹 UI나 특정 사이트에서 어려움을 겪는 브라우저 에이전트를 구축하고 있다면, UI 요소와 내비게이션 패턴을 더 잘 이해하도록 미세 조정 (Fine-tuning)할 수 있습니다.
이 플랫폼은 셀프 서비스 (self-serving) 방식으로 운영되며 https://augento.ai/dashboard 에서 자유롭게 사용할 수 있습니다. 여러분의 에이전트를 연결하고 사용 사례 (use case)에서 관찰 가능한 개선을 이끌어내기에 충분한 $20의 학습 크레딧 (training credits)을 제공해 드립니다.
여러분의 생각과 피드백을 듣고 싶습니다!
AI 자동 생성 콘텐츠
본 콘텐츠는 HN AI Engineering의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기