Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.

Google이 최신 비디오 모델인 Veo 2를 활용하여 Gemini Advanced 및 Google Labs의 Whisk 기능을 통해 사용자들에게 영상 생성 기능을 제공합니다. Gemini에서는 텍스트 프롬프트만으로 고화질, 시네마틱 리얼리즘의 동적 영상을 만들 수 있으며, 최대 8초 길이의 클립을 제작할 수 있습니다. 또한, Whisk Animate를 이용하면 기존 이미지를 Veo 2로 애니메이션화하여 생생한 영상으로 변환할 수 있습니다. 이 기능들은 Google One AI Premium 구독자에게 순차적으로 제공되며, 안전성(
DeepMind가 개발한 Perch 모델 업데이트를 통해, 과학자들이 방대한 생물 음향 데이터를 빠르고 정확하게 분석할 수 있게 되었습니다. 이 새로운 AI 모델은 기존보다 향상된 새 종 예측 성능을 자랑하며, 산호초 같은 해양 환경에도 효과적으로 적응합니다. Xeno-Canto 및 iNaturalist와 같은 공개 출처의 데이터로 훈련되어 포유류, 양서류, 인위적 소음까지 포함하는 광범위한 데이터를 처리할 수 있습니다. 이 모델은 복잡한 음향 장면을 분석하여 개체군 규모 추정이나 번식률 계산 등 다양한 보존 생물학 질문에 답하는
본 글은 'Decoupled DiLoCo'라는 새로운 분산 AI 학습 패러다임을 소개합니다. 이 시스템은 기존 인터넷 연결 수준의 대역폭(2-5 Gbps)만으로도 120억 개 파라미터 모델을 네 개의 미국 지역에 걸쳐 성공적으로 사전 학습할 수 있음을 보여줍니다. 가장 큰 장점은 기존 동기화 방식 대비 20배 이상 빠른 속도로 학습이 가능하다는 점입니다. 또한, 이 시스템은 서로 다른 세대의 하드웨어(예: TPU v6e와 TPU v5p)를 하나의 학습 작업에 혼합하여 사용할 수 있게 함으로써, 자원 활용도를 극대화하고 인프라 병목현

Google이 최신 모델인 Gemini 2.5 Pro Preview (I/O edition)를 공개하며, 특히 코딩 능력과 웹 개발 성능을 대폭 향상시켰습니다. 이 업데이트는 프론트엔드 및 UI 개발의 의미 있는 개선점을 제공하며, 코드 변환, 편집, 복잡한 에이전트 워크플로우 생성 등 근본적인 코딩 작업 전반에 걸쳐 강력한 성능을 보여줍니다. Gemini 2.5 Pro는 WebDev Arena 리더보드에서 1위를 차지했으며, 최신 버전은 함수 호출 오류 감소 및 트리거율 개선과 같은 개발자 피드백까지 반영하여 현업 사용성을 극대화
DeepMind가 개발한 AlphaEvolve은 Google의 강력한 LLM인 Gemini를 활용하여 고급 알고리즘을 직접 설계하는 코딩 에이전트입니다. 기존에는 인간 전문가의 지식과 시간이 필요했던 복잡하고 최적화된 알고리즘 설계 과정을 AI가 주도적으로 수행할 수 있게 함으로써, 연구 및 개발 분야에 혁신적인 변화를 예고합니다. 이 시스템은 단순히 코드를 생성하는 것을 넘어, 문제 정의부터 구조 설계, 그리고 검증까지 전 과정에서 지능적인 지원을 제공하여 알고리즘 발견(algorithm discovery)의 새로운 패러다임을 열
본 글은 AI 모델, 특히 Gemini를 대상으로 하는 최신 위협인 '간접 프롬프트 주입(indirect prompt injections)'에 대한 방어 전략을 다룹니다. 기존의 정적 방어 기법만으로는 진화하고 적응하는 공격(adaptive attacks)을 막기 어렵다는 문제점을 지적합니다. 따라서, 외부 시스템 보호막과 더불어 모델 자체를 강화하는 '모델 경화(model hardening)' 기술을 도입했습니다. Gemini에 실제 시나리오 기반의 대규모 데이터를 파인튜닝하여 악성 주입 명령어를 무시하고 원래 사용자 요청에만 충

구글은 트랜스포머 (Transformer) 아키텍처와 알파고(AlphaGo) 같은 에이전트 시스템 개발 경험을 바탕으로, 범용 인공지능(AGI) 시대를 목표로 하고 있습니다. 핵심 전략은 최신 멀티모달 모델인 Gemini 2.5 Pro를 '세계 모델(world model)'로 확장하는 것입니다. 이는 AI가 세상의 작동 방식을 이해하고 시뮬레이션하며 계획을 세울 수 있게 만듭니다. 궁극적으로는 Gemini 앱을 일상생활 전반의 작업을 처리하고, 사용자에게 능동적인 추천을 제공하는 범용 AI 비서로 진화시키는 것이 목표입니다. 최근에

Google DeepMind가 최신 생성형 미디어 모델(Veo 3, Imagen 4, Lyria 2)을 발표하며 창작자들에게 혁신적인 도구를 제공합니다. 특히 Veo 3는 오디오를 포함한 영상 생성이 가능해졌으며, 기존 Veo 2 모델은 레퍼런스 기반 비디오, 카메라 컨트롤 등 전문가급 기능을 추가했습니다. 또한 AI 영화 제작 도구 Flow와 고품질 이미지 생성기 Imagen 4가 출시되어 예술적 표현의 경계를 넓힙니다. 음악 분야에서는 Lyria 2를 통해 강력한 작곡 기능과 실시간 상호작용이 가능해졌으며, 모든 출력물에는 위변

생성형 AI 기술의 발전으로 인해 텍스트, 이미지, 오디오 등 다양한 형태의 콘텐츠가 폭발적으로 증가하면서 진위 여부 검증이 중요한 과제가 되었습니다. 구글은 이러한 문제를 해결하기 위해 'SynthID Detector'라는 새로운 검증 포털을 발표했습니다. 이 도구는 Google AI로 생성된 미디어에 삽입된 SynthID 워터마크를 빠르고 효율적으로 감지할 수 있습니다. 사용자가 콘텐츠를 업로드하면, 포털은 전체 또는 특정 영역에 걸쳐 워터마크의 존재 여부를 스캔하고 시각적으로 표시해 줍니다. 이는 정보 오용과 출처 혼란을 최소
Google DeepMind가 모바일 환경에 특화된 새로운 경량 오픈 모델 'Gemma 3n'의 프리뷰 버전을 발표했습니다. 이 모델은 높은 효율성과 강력한 성능을 동시에 갖추었으며, 특히 오디오를 포함한 멀티모달 이해 능력을 확장하여 개발자들이 기기에서 실시간으로 상호작용하는 애플리케이션이나 정교한 오디오 중심 경험을 구축할 수 있도록 지원합니다. 2-in-1 구조의 유연성을 제공하며, 온디바이스 AI 구현에 최적화된 솔루션을 제시합니다.

Google은 멀티모달 기능을 극대화한 Gemini 2.5를 통해 AI 기반의 음성 대화(audio dialog)와 콘텐츠 생성을 한 단계 발전시켰습니다. Gemini 2.5는 단순히 텍스트를 넘어, 사람의 말하는 방식(톤, 악센트, 비언어적 표현 등)까지 이해하고 실시간으로 반응합니다. 주요 기능으로는 자연스러운 대화 흐름, 특정 스타일 제어, 검색 결과와 같은 외부 도구 연동이 가능하며, 사용자의 감정 톤에 맞춰 응답하는 '감성 대화(Affective dialog)'도 지원합니다. 또한, 텍스트를 음성으로 변환하는 TTS(텍스트
본 글은 인공지능(AI)을 활용하여 열대성 사이클론(tropical cyclone) 예측의 정확도를 획기적으로 높인 연구 결과를 소개합니다. 기존 물리 기반 모델들은 사이클론의 이동 경로(track)와 강도(intensity)를 동시에 높은 수준으로 예측하는 데 어려움이 있었습니다. 이는 경로가 대기의 거대한 흐름에 의해 결정되는 반면, 강도는 내부의 복잡한 난류 과정에 의존하기 때문입니다. 개발된 새로운 AI 모델은 방대한 재분석 데이터셋과 지난 45년간 관측된 사이클론 데이터를 통합 학습하여 이 상충 관계를 극복했습니다. 테스트

DeepMind는 Gemini 2.5 모델 제품군에 대한 광범위한 업데이트를 발표했습니다. 핵심은 모든 모델이 '생각하는(thinking)' 능력을 갖추게 되어 추론 과정의 정확성과 성능이 향상되었다는 점입니다. 특히, 저지연 및 저비용을 목표로 하는 새로운 모델인 2.5 Flash-Lite가 프리뷰로 공개되었습니다. 이 모델은 대규모 분류나 요약 같은 고처리량 작업에 적합하며, 기본적으로 '생각' 기능이 비활성화되어 비용 효율적입니다. 또한, 개발자 혼란을 줄이기 위해 Gemini 2.5 Flash와 Pro의 안정화 버전 출시 및

Google DeepMind가 Gemini 2.5 모델 제품군을 대폭 확장하고 사용자들에게 더 많은 기능을 제공합니다. 이번 업데이트의 핵심은 2.5 Pro와 2.5 Flash를 안정적인(stable) 버전으로 출시하여 개발자들이 상업적 애플리케이션에 자신 있게 활용할 수 있도록 한 것입니다. 또한, 가장 비용 효율적이고 빠른 모델인 Gemini 2.5 Flash-Lite의 프리뷰 버전을 공개했습니다. 이 신규 모델은 코딩, 수학, 과학, 추론 및 멀티모달 벤치마크에서 이전 버전보다 높은 성능을 보이며, 번역이나 분류 같은 대용량/
Google DeepMind는 Gemini 모델을 활용하여 현장(on-device)에서 구동되는 로봇 시스템 개발에 성공했습니다. 이 기술은 강력한 인공지능 기능을 로컬 기기에 직접 탑재함으로써, 인터넷 연결 없이도 복잡하고 실시간적인 환경 인식 및 추론이 가능한 자율 로봇 구현의 새로운 지평을 열었습니다. Gemini는 다양한 모달리티(multimodality)를 이해하는 능력을 바탕으로, 실제 물리적 세계와 상호작용하는 로봇에게 필요한 고차원적인 인지 능력을 제공합니다. 이는 단순히 원격 제어를 넘어선, 독립적이고 상황 적응적인

딥마인드는 예일대학교와의 연구 협력을 통해 세포 언어를 이해하는 새로운 파운데이션 모델, Cell2Sentence-Scale 27B (C2S-Scale)를 공개했습니다. 이 모델은 암 면역 치료의 난제 중 하나인 '차가운 종양(cold tumor)' 문제를 해결할 잠재적인 방법을 제시했습니다. C2S-Scale을 이용해 특정 조건에서만 면역 신호를 증폭시키는 약물 후보군을 예측했고, 그 결과로 CK2 억제제인 silmitasertib (CX-4945)가 주목받았습니다. 이 모델의 예측은 실험실 테스트(in vitro)를 통해 실제로

AI 비디오 제작 도구인 Flow가 대규모 업데이트를 발표했습니다. 핵심은 최신 모델인 Veo 3.1을 도입하고, 기존 기능 전반에 걸쳐 오디오 지원을 강화한 것입니다. 사용자는 이제 'Ingredients to Video', 'Frames to Video', 'Extend' 같은 기능을 활용하여 시각적 요소뿐만 아니라 풍부하게 생성된 오디오까지 제어하며 장면을 구성할 수 있습니다. 또한, 'Insert'와 'Remove' 같은 새로운 편집 기능을 통해 영상 내 특정 요소를 추가하거나 제거하는 등 더욱 정교한 스토리텔링이 가능해졌고

Google DeepMind가 새로운 전문 모델인 Gemini 2.5 Computer Use를 발표했습니다. 이 모델은 Gemini 2.5 Pro의 시각 이해 및 추론 능력을 기반으로 하며, 사용자가 웹사이트나 애플리케이션의 사용자 인터페이스(UI)와 직접 상호작용하는 에이전트 구축을 가능하게 합니다. 기존 API 방식으로는 처리하기 어려웠던 양식 작성, 드롭다운 메뉴 조작 등 인간과 유사한 복잡한 디지털 작업을 수행할 수 있게 되었습니다. 이 모델은 반복적인 루프를 통해 스크린샷과 사용자 요청을 분석하고 클릭, 타이핑 등의 함수(

본 글은 최고 수준의 성능을 갖춘 '차분 프라이버시 (Differential Privacy, DP)' 기반 대규모 언어 모델(LLM)인 VaultGemma를 소개합니다. AI에 사생활 보호 기능을 핵심으로 통합하는 것이 중요해지면서, 연구진은 DP가 LLM 학습에 미치는 트레이드오프를 분석했습니다. 이들은 '차분 프라이버시 스케일링 법칙 (Scaling Laws for Differentially Private Language Models)'을 수립하여 컴퓨팅 자원, 프라이버시 예산, 데이터 예산 간의 최적 조합을 제시했습니다. 그에

Google DeepMind가 개발한 새로운 경량 언어 모델, Gemma 3 270M이 공개되었습니다. 이 모델은 이름처럼 작고(2억 7천만 개 파라미터), 특정 작업에 최적화된 '컴팩트' 아키텍처를 가졌습니다. 기존의 거대한 범용 모델 대신, 이 모델을 활용하여 텍스트 분류나 데이터 추출 같은 전문적인 태스크에 맞게 미세 조정(fine-tuning)할 수 있습니다. 이를 통해 개발자들은 빠르고 비용 효율적이며 운영이 간소화된 프로덕션 AI 시스템을 구축할 수 있습니다. Gemma 3 270M은 강력한 기본 성능과 함께, 다양한 소