
Liquid AI, 추론 모델의 '둠 루프(doom loop)'를 한 번에 하나의 토큰으로 해결하는 방법을 찾아내다: 언어 모델 Qwen
요약
Liquid AI가 추론 모델의 반복적인 오류 현상인 '둠 루프(doom loop)'를 해결하기 위한 FTPO 방법론과 Antidoom 데이터셋을 공개했습니다. 이는 모델 전체를 재학습시키지 않고도 미세 조정을 통해 루프 발생을 방지하는 핀포인트 수정 방식입니다.
핵심 포인트
- FTPO(Final Token Preference Optimization) 기법을 통한 루프 현상 방지
- Antidoom 데이터셋 공개로 추론 모델의 안정성 개선 지원
- 모델 전체 재학습 없이 미세 조정만으로 오류 수정 가능
- 추론 모델의 컨텍스트 소진 및 토큰 비용 낭비 문제 해결
긴 작업에 추론 모델 (reasoning model)을 실행했을 때, 체인의 중간쯤에서 "잠시만요, 다시 생각해 볼게요..."라고 말하며 멈춰버린 경험이 있나요? 그 이후에는 해결책이 나오는 것이 아니라, 컨텍스트 창 (context window)이 끝날 때까지 동일한 문구, 동일한 실수, 동일한 퇴행이 반복되는 무한한 자책이 이어집니다. 결국 당신은 잘린 출력값과 수천 개의 쓸모없는 토큰에 대한 비용 청구서를 보게 됩니다.
이것을 '둠 루프 (doom loop)'라고 부르며, 2026년 7월 7일 Liquid AI는 모델 전체를 재학습시키지 않고 바로 이 오류를 겨냥한 방법을 발표했습니다. 2026년 7월 7일자 Liquid AI 블로그에 따르면, 해당 방법과 데이터셋은 Antidoom이라는 이름으로 공개되었으며, 학습 기법 자체는 Final Token Preference Optimization (FTPO)입니다.
차례대로 살펴보겠습니다. 정확히 무엇이 고장 났고, 무엇을 고쳤는지, 어떤 수치가 발표되었으며 어떤 모델에 적용되었는지, 그리고 당신이 직접 어떻게 체험해 볼 수 있는지에 대해 다룹니다. 마법 같은 이야기나 "이제 모델이 더 이상 루프에 빠지지 않는다"라는 식의 장담은 하지 않겠습니다.
7월 7일에 무슨 일이 일어났으며 실제로 무엇이 바뀌었는가
핵심: Liquid AI는 추론 모델 (reasoning models)의 루프 현상을 방지하기 위한 공개 방법론과 데이터셋을 게시했습니다. 이것은 새로운 모델이나 제품이 아니라, 미세 조정 (fine-tuning) 방법과 데이터입니다.
2026년 7월 7일자 Liquid AI의 발표에 따르면, FTPO 방법론 자체와 LiquidAI/antidoom-mix-v1.0 데이터셋 두 가지가 공개되었습니다. 이 사건은 Hacker News와 MarkTechPost에서 화제가 되었으며, 논의 과정에서 추론 모델을 위한 일반적인 수정이 아닌 드문 사례인 '핀포인트 수정 (point fix)'으로 주목받았습니다. 이는 커뮤니티의 관심을 끄는 신호이지 품질에 대한 증명은 아닙니다. 논의에 따르면 이 주제가 사람들의 흥미를 끌었지만, 수치는 여전히 직접 검증해야 합니다.
여기서 즉시 구분해야 할 중요한 사항은 다음과 같습니다:
- 벤더의 주장 - Liquid AI는 FTPO가 성능 지표를 떨어뜨리지 않으면서 루프 발생 빈도를 줄인다고 주장합니다.
- 독립적 검증 - 본 자료 작성 시점(2026년 7월 14일) 기준으로, 외부에서 이를 재현한 출판물은 없으며 논의만 존재합니다.
- 저자의 결론 - 이 방법은 논리적으로 보이며 두 개의 체크포인트에서 제한적으로 검증되었습니다. Liquid AI 또한 이 점을 경고하고 있습니다.
만약 당신이 긴 추론 체인 (reasoning chains)을 실행하며 토큰 비용을 지불하고 있다면, 여러 모델 제품군을 자신의 작업에 맞춰 비교할 수 있는 테스트베드를 한 번 구축해 두는 것이 좋습니다. 이를 통해 여러 모델을 하나의 러시아 서비스 접속을 통해 복잡한 API 키 관리 없이 빠르게 연결할 수 있습니다.
둠 루프(doom loop)란 무엇이며 왜 비용이 많이 드는가
핵심: 둠 루프(doom loop)는 모델이 의구심을 나타내는 문구에 갇혀 컨텍스트 창이 소진될 때까지 이를 반복하는 현상을 말합니다.
Liquid AI의 설명에 따르면, 둠 루프는 특히 추론 모델 (reasoning models)에서 자주 발생하는 오류입니다. 메커니즘은 단순하고 명확합니다. 모델이 "잠시만요, 다시 생각해 볼게요..."와 같은 말을 내뱉은 뒤, 동일한 구조를 계속해서 반복하는 것입니다. 추론 체인이 정답으로 수렴하지 못하고, 컨텍스트 제한에 부딪힐 때까지 제자리를 맴돌게 됩니다.
이것이 비용과 제품에 타격을 주는 이유:
- 출력되는 모든 토큰에 대해 비용을 지불해야 하는데, 무한 반복되는 생성 과정이 컨텍스트 창 전체를 잡아먹습니다.
- 사용자는 끊기거나 빈 답변을 받게 됩니다. 모델이 "생각"은 했지만, "결론"을 내지 못한 것입니다.
- 타이밍이 어긋납니다. 한 번 루프에 빠진 생성은 정상적인 생성보다 몇 배나 더 많은 시간이 걸릴 수 있습니다.
- 재시도 (retries)로도 해결되지 않습니다. 탐욕적 샘플링 (greedy sampling) 환경에서 모델은 결정론적으로 동일한 함정에 빠지게 됩니다.
이를 일반적인 "수다스러움 (verbosity)"과 혼동해서는 안 됩니다. 수다스러운 모델은 최소한 답변을 향해 나아갑니다. 반면 둠 루프는 특정 전환 지점에서 멈춰버리는 현상으로, 사고를 이어가는 대신 모델이 반복적으로 의구심을 나타내는 토큰을 선택하는 것입니다.
FTPO의 작동 원리: 최종 토큰에서의 수정
핵심: FTPO는 루프가 시작되는 토큰을 찾아내어, 다른 확률 분포는 거의 건드리지 않은 채 바로 그 위치에서 모델이 일관성 있는 대안을 선호하도록 학습시킵니다.
Liquid AI의 설명에 따른 이 방법의 아이디어는 다음과 같습니다. 일반적인 둠 루프는 무작위로 발생하는 것이 아니라, 특정 생성 지점, 즉 모델이 반복에 빠지게 되는 특정 최종 토큰(terminating token)에서 시작됩니다. FTPO는 이러한 위치를 정밀하게 타격하여 작동합니다.
Liquid AI가 설명하는 표준 DPO와 FTPO의 세 가지 차이점:
- 종료 토큰(terminating tokens)에만 집중. DPO는 일반적으로 전체 답변 수준에서 선호도를 최적화합니다. 반면 FTPO는 루프(looping)가 발생하는 지점인 바로 그 최종 토큰들을 대상으로 학습합니다.
- 예시당 여러 개의 선택된 대안 사용. 하나의 예시에 대해 "좋은 답변 대 나쁜 답변"이라는 엄격한 쌍을 사용하는 대신, FTPO는 하나의 예시에 대해 여러 개의 수용 가능한 연속된 토큰(continuations)을 허용합니다.
- 로짓(logits) 공간에서의 KL 유사 손실(KL-like loss). 학습은 분포를 최소한으로 변경하도록 설계되었습니다. 즉, 문제 지점의 동작만 수정하고 나머지 부분은 흐트러뜨리지 않습니다.
마지막 항목은 실무에서 핵심적인 부분입니다. 분포에 대한 개입을 최소화했기 때문에 벤치마크(benchmark) 성능이 떨어지지 않는 것입니다. 즉, 모델 전체를 새로운 목표에 맞춰 재학습(overfitting)시키는 것이 아니라, 좁은 결함만을 수리하는 방식입니다.

Liquid AI의 발표에 따르면, 전체 미세 조정(fine-tuning) 과정은 몇 시간밖에 걸리지 않습니다. 이는 며칠씩 걸리는 실행이 아니라, 이미 준비된 체크포인트(checkpoint) 위에 수행되는 정밀한 작업입니다.
발표된 수치와 적용 모델
중요: 수치는 훌륭하지만, 이는 "일반적인" 결과가 아니라 두 가지 구체적인 체크포인트에서 얻은 결과입니다.
Liquid AI는 두 가지 결과를 제시합니다.
| 모델 (체크포인트) | FTPO 적용 전 doom loop 빈도 | FTPO 적용 후 | 조건 |
|---|---|---|---|
| LFM2.5-2.6B (초기 체크포인트) | 10.2% | 1.4% | Liquid AI 데이터 기준 |
| Qwen3.5-4B | 22.9% | 1% | Greedy sampling, Liquid AI 데이터 기준 |
Liquid AI의 게시물에 따르면, Qwen3.5-4B의 경우 Greedy sampling 시 루프 발생 빈도가 22.9%에서 1%로 떨어졌으며, 동시에 벤치마크 점수는 하락하지 않고 오히려 상승했습니다. LFM2.5-2.6B 초기 체크포인트에서는 doom loop 빈도가 10.2%에서 1.4%로 감소했습니다.
이제 솔직한 프레임워크를 말씀드리겠습니다. Liquid AI 스스로도 경고하기를, 결과는 특정 체크포인트인 LFM2.5와 Qwen3.5를 기준으로 제시되었으며, 이 방법론의 다른 아키텍처에 대한 일반화 가능성은 검증된 것으로 주장하지 않았습니다. 즉, 여기서 언급된 언어 모델 Qwen은
여러 모델 제품군에 대해 측정 자체를 일관되게 수행하려면, 하나의 OpenAI 호환 엔드포인트(endpoint)를 통해 모델들을 호출하는 것이 편리합니다. 키(Key)와 주소는 플레이스홀더(placeholder)이므로, 본인의 것으로 교체하여 사용하세요:
from openai import OpenAI
client = OpenAI(
...

여기서 단일 엔드포인트를 사용하는 목적은 단순히 편의를 위한 것이 아니라, 실험의 순수성(purity)을 위해서입니다. 즉, 동일한 코드와 동일한 파라미터(parameter)를 사용하되 모델만 다르게 설정함으로써, SDK의 차이와 모델 동작의 차이를 혼동하지 않도록 하는 것입니다.
비용 부담 없이 모델을 선택하는 방법
핵심: Antidoom 자체는 미세 조정(Fine-tuning)에 관한 것이지만, 이 노력이 투입할 가치가 있는지 결정하려면 먼저 저렴한 방식으로 비교를 수행할 수 있어야 합니다.
실질적인 질문은 다음과 같습니다. 특정 모델을 FTPO 방법으로 수정할 것인가, 아니면 당신의 작업에서 '둠 루프(doom loop)'가 더 적게 발생하는 다른 모델로 단순히 교체할 것인가? 그 답은 당신이 인퍼런스(inference)를 어디에서 실행하느냐와 그 비용이 얼마냐에 달려 있습니다.
결정을 위한 간단한 표:
| 상황 | 더 합리적인 선택 | 이유 |
|---|---|---|
| 모델을 자체 호스팅(self-host)하며, 루프 현상이 광범위하게 발생함 | FTPO 시도 | 가중치(weight)에 대한 제어권이 있으며, Liquid AI의 주장에 따르면 미세 조정은 몇 시간 내에 완료됨 |
| ... |
두 번째와 세 번째 경우를 위해서는 하나의 인터페이스를 통해 다양한 모델 제품군에 접근할 수 있어야 합니다. 러시아에서 해외 모델을 비교하는 경우, provod.ai는 Claude, GPT, Gemini, DeepSeek, Qwen을 하나의 채팅창과 하나의 API에서 제공하며, 단일 루블 잔액으로 VPN이나 해외 카드 없이 러시아 카드, SBP 또는 계좌 이체를 통해 결제할 수 있습니다. 팀 단위의 경우 계약서, 인보이스 및 증빙 서류 처리도 가능합니다.
중요한 솔직한 고지: 이러한 액세스를 통해 당신은 비교 및 라우팅 (routing)을 위해 여러 제품군(families)의 스톡 모델 (stock models)을 가져오게 됩니다. FTPO 수정 사항이 이미 내장된 완성된 체크포인트 (checkpoint)는 그곳에 없습니다. 그것은 Liquid AI의 방식에 따라 자신의 모델을 미세 조정 (fine-tuning)하여 직접 얻어야 하는 것입니다. 애그리게이터 (Aggregator)는 선택과 비교를 도와줄 뿐, 미세 조정을 대체하지는 않습니다.

파이프라인 측정 및 분석 시 빈번한 오류
핵심: 실패의 대부분은 방법론의 문제가 아니라, 어떻게 측정하고 어떻게 체인을 구성하느냐에서 발생합니다.
전형적인 실수들:
- 잘못된 샘플링 (sampling) 방식으로 측정함. Qwen3.5-4B의 둠 루프 (doom loop)는 소스에서 탐욕적 샘플링 (greedy sampling) 시 발생하는 것으로 명시되어 있습니다. 만약 높은 온도 (temperature) 설정으로 측정한다면 결과가 흐려져 잘못된 결론을 내릴 수 있습니다.
- 모든 반복을 결함으로 간주함. 긴 추론 과정에서 문구를 반복하는 것은 정상입니다. 결함은 정답으로 나아가는 진전 없이 정체되는 것을 의미합니다. 이를 구분하십시오.
- 두 개의 체크포인트 결과를 전체로 일반화함. 10.2% -> 1.4% 및 22.9% -> 1%라는 수치는 두 지점의 데이터일 뿐입니다. Liquid AI는 다른 아키텍처로의 전이 가능성을 직접적으로 주장하지 않습니다.
- 루핑 감소와 품질 향상을 혼동함. Liquid AI의 데이터에 따르면 메트릭 (metrics)이 상승했지만, 이는 해당 벤치마크 (benchmarks)에서의 측정치입니다. 당신의 작업에서는 별도로 확인하십시오.
만약 n8n과 같은 로우코드 (low-code) 환경에서 호출을 오케스트레이션 (orchestrate)하고 있다면, 생성 노드 바로 뒤에 탐지 노드를 추가하십시오. 이 노드는 응답을 동일한 looks_like_doom_loop로 통과시키며, 작동 시 다른 모델로 재시도하거나 알림을 보내는 분기로 연결합니다. 이렇게 하면 사용자에게 끊긴 체인을 보내지 않으면서, 프로덕션 환경에서의 실제 정체 통계를 정직하게 수집할 수 있습니다.

AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기