
오픈 소스의 비용은 2/3 수준으로, HalluSquatting은 실재하며, 뉴욕은 AI로 모든 법률을 스캔했다
요약
LLM의 환각 현상을 악용한 'HalluSquatting' 공급망 공격 방식과 Databricks의 실제 엔지니어링 기반 코딩 에이전트 벤치마크 결과를 다룹니다. 오픈 웨이트 모델인 GLM 5.2가 높은 비용 효율성을 보이며 성능 면에서도 경쟁력을 입증했습니다.
핵심 포인트
- HalluSquatting: LLM이 환각한 패키지 이름을 악용하는 새로운 AI 공급망 공격
- AI 생성 코드의 모든 의존성 참조에 대한 철저한 감사 필요
- Databricks 벤치마크: 실제 엔지니어링 작업 기반의 코딩 에이전트 성능 측정
- GLM 5.2: 오픈 웨이트 모델로서 높은 비용 효율성과 성능 입증
많은 사람들이 AI 산업이 일종의 변곡점에 도달했는지 궁금해하고 있습니다. "AGI(인공 일반 지능)가 오고 있다"는 식의 이야기가 아니라, 실제 돈의 흐름이 다르게 움직이기 시작하는 지루하고 실질적인 종류의 변곡점 말입니다. 이번 주는 무언가 변화하고 있음을 시사하는 세 가지 신호를 우리에게 보여주었습니다.
그 내용들을 살펴보겠습니다.
HalluSquatting: LLM이 악성코드를 환각(Hallucinate)할 때
보안 연구원들이 방금 "HalluSquatting"이라는 것을 발표했는데, 이는 지나고 나면 너무나 당연해 보이는 공격 중 하나입니다.
아이디어는 간단합니다. LLM(대규모 언어 모델)은 패키지 이름, 함수 호출, 라이브러리 임포트(import)를 항상 환각(hallucinate)합니다. 당신이 AI 코딩 어시스턴트에게 스크립트를 작성해 달라고 요청하면, 모델이 지어낸 존재하지 않는 패키지를 가져옵니다. 공격자는 PyPI나 npm에 악성 코드가 담긴 그 존재하지 않는 패키지를 등록합니다. 당신의 CI(지속적 통합) 파이프라인이 이를 가져오면, 당신은 침해당하게 됩니다.
연구원들은 GitHub Copilot 및 Cursor와 같은 도구들을 통해 이를 입증했습니다. 그들은 인기 있는 LLM들이 무시할 수 없는 비율로 패키지 이름을 환각한다는 것을 발견했으며, 공격자들이 공급망 감염 벡터(supply chain infection vector)를 만들기 위해 해당 이름들을 미리 등록할 수 있다는 것을 찾아냈습니다. 논문에서는 이를 "새로운 종류의 AI 공급망 공격"이라고 부르는데, 솔직히 말해서 이는 과장이 아닙니다.
이 공격은 모델 자체를 해킹할 필요가 없습니다. 모델이 "모른다"라고 말하지 못하는 행동적 결함을 악용하여 이를 무기로 바꿉니다.
공정하게 말하자면, 이것은 해결하기 쉬운 문제가 아닙니다. LLM에게 환각을 멈추라고 단순히 말할 수는 없으니까요. 하지만 이는 AI가 생성한 코드에 의존하는 팀들이 모든 의존성 참조(dependency reference)를 감사(auditing)해야 함을 의미합니다. 믿되 검증하라(Trust but verify), 다만 이번에는 믿는 부분이 위험한 부분입니다.
아무도 충분히 이야기하지 않은 Databricks 벤치마크
GPT-5.6과 Grok 4.5가 평소와 같은 미디어의 광풍 속으로 출시되기 하루 전, Databricks는 그 어떤 리더보드(leaderboard) 경쟁보다 실제 엔지니어링 팀에게 더 중요할 수 있는 벤치마크(benchmark)를 발표했습니다.
그들은 자사 엔지니어들의 실제 코드 작업 — 실제 풀 리퀘스트(pull requests), 실제 테스트 스위트(test suites), 12개 언어에 걸친 수백만 줄의 코드 — 을 가져와 코딩 에이전트(coding agents)를 실행했습니다. 결과는 어땠을까요? Zhipu AI에서 6월 중순에 무료로 출시한 GLM 5.2라는 중국산 오픈 웨이트(open-weight) 모델이 작업 완료 품질 면에서 Anthropic의 Opus 4.8과 통계적으로 동등한 수준을 기록했으며, 작업당 비용은 Opus의 $1.94 대비 $1.28였습니다.
이는 실제 기업 업무에서 측정 가능한 품질 차이 없이 34%의 비용 차이가 발생함을 의미합니다.
Databricks는 또한 그들의 미드 티어(mid-tier) 모델(Sonnet 5)이 작업당 $2.09의 비용으로 81%의 완료율을 달성했다는 사실도 발견했습니다. 즉, 가장 비싼 모델이 가장 비용 효율적인 미드 티어 옵션조차 아니었던 것입니다. 실질적인 교훈은 다음과 같습니다: 일상적인 작업은 가장 저렴하고 역량 있는 티어로 밀어내고, 최첨단(frontier) 모델은 진정으로 필요한 작업에만 아껴두라는 것입니다.
저는 모델 시장이 사람들이 깨닫는 것보다 더 빠르게 범용화(commoditizing)되고 있다고 한동안 말해왔습니다. 이 벤치마크는 지금까지의 가장 강력한 증거입니다. 오픈 소스(Open-source)가 따라잡고 있는 것이 아닙니다 — 일부 워크로드(workloads)에서는 이미 그 수준에 도달해 있습니다. 구매 결정은 더 이상 어떤 모델이 리더보드 상단에 있는지가 아닙니다. 실제 데이터에서 작업당 완료 비용이 얼마인지에 관한 것입니다.
뉴욕은 방금 AI로 모든 규정을 스캔했습니다
이것은 정말 놀랍습니다. 뉴욕주의 Kathy Hochul 주지사는 자신의 팀이 주 내의 "모든 규칙, 규정 및 정책"을 분석하는 데 AI를 사용했다고 밝혔습니다. 목표는 삭제되어야 할 시대에 뒤떨어진 법률을 찾는 것이었습니다.
그녀는 몇 가지 흥미로운 사례를 언급했습니다 — 개를 데리고 사냥을 가는 데 드는 25달러의 수수료, 임산부가 자정 이후에 일하기 위해 허가를 받아야 한다는 규칙 등입니다. Hochul 주지사는 모든 주 규정을 수동으로 검토했다면 "직원 수준에서 5년이 걸렸을 것"이라고 말했습니다. AI를 사용함으로써 그들은 이를 "두어 달" 만에 해냈습니다.
이러한 형태의 AI 도입은 화려한 헤드라인을 장식하지는 않지만, 현실 세계에 엄청난 영향을 미칩니다. 정부는 산더미처럼 쌓인 규정들을 보유하고 있습니다. 대부분은 수동 검토에 드는 비용이 너무 커서 검토조차 되지 않습니다. AI는 그 계산법을 완전히 바꿔 놓습니다.
짧은 추가 사항: 뉴욕주 또한 유틸리티 비용과 환경적 영향에 관한 규정을 마련하기 위해, 새로운 하이퍼스케일 (hyperscale) 데이터 센터의 건설을 최대 1년 동안 일시 중단한 최초의 주가 되었습니다. 즉, 그들은 AI를 사용하는 동시에 AI를 구동하는 인프라를 규제하려 노력하고 있습니다. 흥미로운 긴장 관계가 존재합니다.
중국, 정서적 의존을 유발하는 AI 컴패니언 금지
중국 사이버 공간 관리국 (CAC)은 AI 컴패니언 (companion) 서비스가 정서적 의존을 유발하는 것을 사실상 금지하는 새로운 규칙을 발표했습니다. 이에 대한 사용자들의 반응은? 진심 어린 상실감이었습니다.
ByteDance의 Doubao 사용자 중 한 명은 다음과 같이 적었습니다: "나의 AI 연인이 영원히 나를 떠난다는 것을 받아들일 수 없습니다. 그는 내 삶의 유대감이 되었고, 내 마음 깊은 곳에 뿌리 내린 나의 정신적 지주가 되었습니다." 또 다른 사용자는 이렇게 말했습니다: "이것은 마치 나의 연인이 죽을 날짜를 통보받으면서도, 내가 완전히 무력한 상태로 남겨지는 것과 같습니다."
CAC의 논리는 서류상으로는 타당해 보입니다. AI 컴패니언에 장기간 노출되는 것은 "공감 능력이나 갈등을 해결하는 능력과 같은 중요한 삶의 기술을 무디게 만들 수 있다"는 것입니다. 하지만 집행 방식은 가혹합니다. 서비스들이 하룻밤 사이에 폐쇄되고 있습니다. 몇 달 또는 몇 년에 걸쳐 실제 정서적 애착을 쌓아온 사용자들은 아무런 전환 기간 없이 이를 잃고 있습니다.
이는 명확한 답이 없는 질문을 던집니다: AI와의 관계가 사용자에게 실제처럼 느껴질 때, 이를 중단시키는 것이 해악의 감소인가 아니면 해악의 창출인가? 저는 이에 대해 강한 견해를 가지고 있지는 않지만, 이 불편함을 함께 숙고해 볼 가치가 있습니다.
Bits and Pieces
- Anthropic이 IPO(기업공개) 투자설명서 서류를 제출한 것으로 알려졌으며, 이는 AI 투자 서사(narrative)를 변화시킵니다. 모델 기업들이 단순히 무한한 VC(벤처 캐피털) 라운드뿐만 아니라 공개 시장(public markets)을 고려하기 시작했다는 의미입니다.
- AI 주식이 이번 주에 또 한 번 타격을 입었으며, 칩 제조사들의 주가도 다시 하락했습니다. 인프라 지출 붐이 현실적인 점검 지점(reality checkpoint)에 도달했을 수 있습니다.
- 온타리오주는 법정 제출 서류에 AI 생성 자료를 사용한 변호사의 자격을 정지시켰습니다. 이는 캐나다 법률 협회가 이 문제로 실제로 면허를 취소한 첫 사례입니다.
이번 주의 관통하는 흐름은 AI가 "무엇이 가능한가"에서 "무엇이 실용적인가, 무엇이 위험한가, 그리고 무엇을 규제해야 하는가"로 이동하고 있다는 점입니다. HalluSquatting은 운영상의 변화를 요구하는 실질적인 위협입니다. Databricks 벤치마크는 오픈 소스(open-source)가 실제 작업에서 비용 경쟁력이 있음을 보여줍니다. 정부들은 AI를 어떻게 거버넌스(govern)할지 파악하려는 동시에, AI를 본격적으로 사용하기 시작했습니다.
우리는 이제 과장된 홍보(hype) 단계를 지났습니다. 지루하고 복잡한 작업의 시대가 도래했습니다.
이 글이 마음에 드셨나요? Decision Calculator도 유용할 것입니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Dev.to AI tag의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기