Insights
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
© 2026 Molayo
AI가 자동으로 큐레이션·번역·정리하는 기술 동향 피드입니다.
본 페이지의 콘텐츠는 AI가 공개된 소스를 기반으로 자동 수집·요약·번역한 것입니다. 원 저작권은 각 원저작자에게 있으며, 각 게시물의 “원문 바로가기” 링크를 통해 원문을 확인할 수 있습니다. 저작권자의 삭제 요청이 있을 경우 신속히 조치합니다.
Google은 전문가 수학자, 물리학자 등과 협력하여 개발한 'Gemini Deep Think' 모드를 통해 전문적인 연구 문제 해결에 성공했다고 발표했습니다. 이 시스템은 단순히 지식을 나열하는 것을 넘어, 복잡하고 개방된 과학적 난제를 다루는 데 초점을 맞추고 있습니다. 특히 수학 분야에서는 'Aletheia'라는 전용 에이전트를 구축하여, 기존의 학술 연구 수준 문제를 해결할 수 있는 능력을 입증했습니다. 이 에이전트는 자연어 검증기(natural language verifier)를 통해 풀이 과정의 오류를 찾아내고, 실패를
DeepMind가 개발한 AI 모델 'AlphaEarth Foundations'는 위성에서 수집되는 방대한 양의 지구 관측 데이터를 통합하여, 지구 전체를 하나의 통일된 디지털 표현(embedding)으로 만들어냅니다. 이 기술은 기존에 파편화되어 사용하기 어려웠던 다중 모드 데이터를 효율적으로 처리할 수 있게 합니다. 이를 통해 과학자들은 식량 안보, 삼림 벌채, 도시 확장 등 중요한 환경 문제에 대해 더욱 정확하고 일관성 있는 지구의 변화상을 파악하여 의사결정을 내릴 수 있습니다. 또한, 이 모델의 연간 임베딩 데이터를 '위성임
Google DeepMind는 최신 비디오 생성 모델인 Veo를 활용하여 단편 영화 'ANCESTRA'를 제작했습니다. 이 작품은 실사 촬영 장면과 AI가 생성한 시퀀스를 결합하는 혁신적인 방식을 보여줍니다. 제작 과정에서 Gemini로 프롬프트를 개발하고, Imagen으로 컨셉 아트를 만든 후, Veo를 통해 애니메이션을 구현했습니다. 특히, '개인화된 비디오 생성' 기능으로는 자궁 속 신생아 영상을 높은 사실성으로 만들었고, '모션 매칭(Motion Matching)' 기능을 사용해 복잡한 카메라 움직임과 생체 내부 장면을 정교

Gemma 모델은 이미 커뮤니티를 통해 폭발적인 성장을 거듭하며 다양한 분야에 활용되고 있습니다. 이를 기반으로, 온디바이스 AI 성능을 혁신적으로 끌어올린 'Gemma 3n'이 전격 공개되었습니다. Gemma 3n은 모바일 환경에 최적화된 아키텍처를 채택했으며, 핵심 기술로 MatFormer (Matryoshka Transformer)와 Per-Layer Embeddings (PLE)를 도입했습니다. 이 덕분에 클라우드급 성능을 온디바이스에서 구현할 수 있게 되었으며, 개발자는 E4B 및 E2B 모델 외에도 'Mix-n-Match

Google Research가 의료 분야 인공지능(AI) 개발을 가속화할 수 있는 강력한 오픈 모델 컬렉션 'MedGemma'를 공개했습니다. MedGemma는 Gemma 3 기반의 다중 모드 생성 모델로, 4B 및 27B 크기 변형을 포함하며 이미지와 텍스트 입력을 받아 텍스트 출력을 생성합니다. 특히 최신 버전인 MedGemma 27B Multimodal은 복잡한 다중 모드 및 종단적 전자의무기록(EHR) 해석 기능을 지원합니다. 또한, 의료 이미지를 위한 경량 인코더 'MedSigLIP'도 함께 출시되어 분류, 검색 등 다양한

최근 LLM 시장은 디코더 전용 아키텍처에 집중되었으나, T5와 같은 인코더-디코더 구조는 요약, 번역 등 실제 응용 분야에서 여전히 강점을 가집니다. DeepMind가 발표한 T5Gemma는 기존의 디코더 전용 Gemma 모델을 '적응(adaptation)' 기술을 통해 인코더-디코더 아키텍처로 변환하여 새롭게 선보인 LLM 컬렉션입니다. 이 모델은 적응된 Gemma 2 2B 및 9B와 T5 크기의 다양한 모델들로 구성되어 있습니다. 실험 결과, T5Gemma는 디코더 전용 모델 대비 동등하거나 더 나은 성능을 보이며, 특히 추론

구글 딥마인드와 구글은 인공지능(AI)을 활용하여 수학적 발견 속도를 높이는 'AI for Math Initiative'를 시작합니다. 이 이니셔티브는 세계적인 명문 연구 기관 5곳과 협력하며, AI가 난제 해결에 기여할 방안을 모색합니다. 참여 기관들은 AI 기반 통찰력을 얻을 수 있는 수학 문제를 정의하고, 이를 뒷받침할 인프라 및 도구를 구축하는 데 집중합니다. 구글은 Gemini Deep Think와 같은 최첨단 기술과 자금 지원을 제공하며, 이는 기초 연구와 응용 AI 간의 강력한 피드백 루프를 형성하여 과학 전반의 혁신을
본 글은 인공지능(AI) 기술이 지구의 생물권(biosphere)을 어떻게 매핑하고 모델링하며 이해하는지에 대한 최신 연구 성과를 소개합니다. 특히 기후 변화와 자원 고갈로 인해 위협받는 환경 보호에 AI가 핵심적인 역할을 할 수 있음을 강조합니다. 주요 발표 내용으로는 1km² 해상도로 삼림 벌채 위험을 예측하는 모델, 방대한 생물종 데이터를 통합하여 종의 서식지 범위를 추론하는 새로운 접근법, 그리고 소리(bioacoustics)를 분석해 야생동물의 건강 상태를 진단하는 'Perch' 모델 업데이트 등이 있습니다. 이러한 기술적
최신 연구는 인공지능(AI) 모델의 시각적 표현을 재구성하여 성능과 신뢰성을 높일 수 있음을 보여줍니다. 기존 AI 비전 모델은 사물을 분류하는 데 능하지만, 인간처럼 개념 간의 관계나 계층 구조를 이해하지 못할 때가 있습니다. 연구진은 인지과학의 '이상한 것 찾기(odd-one-out)' 과제를 활용하여 이러한 불일치를 분석했습니다. 그 결과, AI 내부 지도를 재정렬하는 3단계 방법을 개발했으며, 이를 통해 모델이 사물 범주별로 개념적 거리에 따라 구조화된 방식으로 시각 정보를 처리하도록 개선할 수 있었습니다.
DeepMind는 범용 AI 에이전트의 다음 단계인 SIMA 2를 공개했습니다. 이전 버전의 SIMA가 단순한 명령어 수행에 그쳤다면, SIMA 2는 Gemini 모델을 핵심으로 통합하여 사용자와 상호작용하며 목표를 추론하고 스스로 학습하는 능력을 갖추었습니다. SIMA 2는 복잡한 게임 환경에서 단순히 지시를 따르는 것을 넘어, 자신의 행동 계획과 의도를 설명할 수 있습니다. 또한, 이 에이전트는 새로운 가상 세계(Genie 3)에서도 적응하며, 시행착오와 Gemini 기반 피드백을 통해 스스로 능력을 향상시키는 자율 개선 사이클

Google DeepMind가 최첨단 AI 기상 예측 모델인 WeatherNext 2를 공개했습니다. 이 모델은 기존 대비 월등히 빠르고 정확하며, 최대 1시간 단위의 고해상도 글로벌 날씨 예측을 제공합니다. 특히 단일 입력값으로부터 수백 가지의 가능한 시나리오를 생성할 수 있어, 극한 상황까지 고려한 포괄적인 계획 수립이 가능합니다. WeatherNext 2는 Functional Generative Network (FGN)라는 새로운 AI 모델링 접근 방식을 통해 물리적으로 현실적이고 상호 연결된 예측을 수행하며, 이미 Earth
구글 딥마인드가 싱가포르에 새로운 연구소를 설립하며 아시아 태평양(APAC) 지역의 AI 역량 강화에 집중합니다. 이는 APAC 시장의 거대한 잠재력과 싱가포르 정부의 선진적인 'National AI Strategy 2.0' 등의 지원을 바탕으로 합니다. 신규 연구소는 정부, 기업, 학계 등 광범위한 파트너들과 협력하여 Gemini와 같은 최신 모델의 핵심 기능을 발전시키고, 특히 언어적/문화적 포용성을 갖춘 기초 연구에 초점을 맞춥니다. 이미 싱가포르 내에서 알파폴드(AlphaFold)를 활용한 질병 연구, 정부 서비스 개선을 돕

Google DeepMind가 개발자들을 위해 고성능 이미지 생성 및 편집 모델인 'Nano Banana Pro (Gemini 3 Pro Image)'를 출시했습니다. 이 모델은 Gemini 3 Pro 기반으로 제작되어 스튜디오급 품질의 이미지를 구현할 수 있습니다. 특히, 텍스트 렌더링 정확도가 높고, 물리적 요소(조명, 카메라 등)에 대한 정교한 제어가 가능하며, Google Search와의 연동을 통해 실시간 웹 지식을 활용하여 사실적인 결과물을 생성합니다. 이 모델은 현재 Google AI Studio와 Vertex AI를介

구글은 제미나이(Gemini) 앱에 AI 이미지 검증 기능을 추가하여 콘텐츠 투명성을 높입니다. 사용자는 이미지를 업로드하고 'Google AI로 생성되었는지' 질문함으로써, 구글의 디지털 워터마킹 기술인 SynthID를 통해 출처 정보를 확인할 수 있습니다. 이 기능은 구글 AI가 만든 이미지나 편집된 내용에 보이지 않는 신호를 삽입하여 콘텐츠의 진위 여부를 판별하는 역할을 합니다. 앞으로 SynthID 검증을 비디오와 오디오 등 다른 형식으로 확장하고, C2PA(Coalition for Content Provenance and)

구글 딥마인드가 최신 생성 음악 모델 'Lyria 3'를 제미나이 앱에 베타 출시하며 사용자들의 창의적인 자기표현을 지원합니다. 사용자는 간단한 설명이나 사진/영상을 업로드하는 것만으로도 원하는 분위기와 장르의 고품질 맞춤형 트랙을 즉시 생성할 수 있습니다. Lyria 3는 프롬프트 기반으로 가사를 자동 생성하며, 스타일, 보컬, 템포 등 창작 요소에 대한 통제력을 높였습니다. 또한, 모든 생성 트랙에는 구글 AI가 만든 콘텐츠임을 식별하는 워터마크인 SynthID가 삽입되어 책임 있는 개발을 강조합니다. 이 기능은 유튜브 크리에이

Google이 핵심 추론 능력을 대폭 강화한 새로운 AI 모델, Gemini 3.1 Pro를 출시했습니다. 이 모델은 단순 답변을 넘어 복잡하고 다층적인 문제 해결에 초점을 맞췄으며, 개발자, 기업, 일반 사용자 모두에게 제공됩니다. 특히 ARC-AGI-2와 같은 까다로운 벤치마크에서 이전 버전 대비 월등한 성능을 보여주었습니다. Gemini 3.1 Pro는 웹사이트용 애니메이션 SVG 생성, 복잡한 시스템 대시보드 구축, 인터랙티브 디자인 구현 등 실질적인 응용 분야에서 강력한 추론 능력을 입증했습니다. 현재 API 및 주요 제품

Google DeepMind가 새로운 이미지 생성 모델 'Nano Banana 2'를 출시했습니다. 이 모델은 기존의 고급 기능(Pro)과 Gemini Flash의 초고속 처리 능력을 결합한 것이 특징입니다. 사용자는 이제 빠르고 쉽게 고품질 이미지를 생성하고 수정할 수 있습니다. 주요 개선점으로는 실시간 웹 검색 기반의 심층적인 세계 지식 활용, 정확한 텍스트 및 번역 기능 구현, 그리고 최대 5개 캐릭터와 14개 객체의 일관성을 유지하는 향상된 제어 능력이 포함됩니다. 또한, Google은 AI 생성 콘텐츠 식별을 위해 'Syn

Google이 대용량 워크로드에 특화된 새로운 AI 모델, Gemini 3.1 Flash-Lite를 공개했습니다. 이 모델은 Google AI Studio와 Vertex AI를 통해 개발자 및 기업에게 프리뷰로 제공됩니다. 가장 큰 장점은 뛰어난 비용 효율성과 속도입니다. 입력 토큰당 $0.25, 출력 토큰당 $1.50의 저렴한 가격으로 2.5 Flash보다 훨씬 빠르며, 응답 시간(Time to First Answer Token)이 2.5배 더 빠르고 출력 속도는 45% 향상되었습니다. 또한, Gemini 3.1 Flash-Lte
10년 전, 알파고(AlphaGo)는 바둑 세계 챔피언을 이기며 인공지능(AI)의 새로운 시대를 열었습니다. 초기 성공은 단순한 게임 승리를 넘어, AI가 현실 과학 문제 해결에 적용될 수 있음을 증명했습니다. 이후 개발된 알파제로(AlphaZero)와 알파폴드(AlphaFold)는 이러한 잠재력을 극대화했습니다. 특히 알파폴드는 단백질 구조 예측이라는 50년 난제를 해결하며 생물학 분야에 혁명을 일으켰고, 수학적 추론이나 알고리즘 발견 등 다양한 영역에서 AI의 역할을 확장하고 있습니다. 이는 AGI(Artificial Super

Google DeepMind는 인공일반지능(AGI)에 도달하는 과정을 객관적으로 측정하기 위한 새로운 인지적 프레임워크를 발표했습니다. 이 프레임워크는 심리학, 신경과학 등 여러 학문의 연구 결과를 바탕으로 10가지 핵심 인지 능력을 정의합니다. 주요 능력으로는 지각(Perception), 생성(Generation), 주의(Attention), 학습(Learning), 기억(Memory), 추론(Reasoning), 메타인지(Metacognition) 등이 포함됩니다. 단순히 이론에 머무르지 않고, 이 프레임워크를 실제 적용하기에,