Amazon Nova 2.5 Sonic과 Strands Agents로 Bidi Agent 만들기
요약
Amazon Nova 2.5 Sonic은 음성 인식, LLM 추론, TTS를 통합한 speech-to-speech 모델로, 대화 과정에서 목소리 톤이나 간격 같은 정보를 유지할 수 있습니다. Strands Agents의 Bidi Agents는 이러한 양방향 스트리밍(bidirectional streaming) 기능을 구현하여 연속적인 음성 대화를 가능하게 합니다. 이들을 활용해 웹 검색 및 음성 답변이 가능한 에이전트를 구축하는 방법을 소개합니다.
핵심 포인트
- Nova 2.5 Sonic은 세 가지 단계를 통합한 speech-to-speech 모델입니다.
- 음성을 그대로 이해하고 생성하여 자연스러운 대화가 가능합니다.
- Bidi Agents는 양방향 스트리밍으로 연속적인 음성 대화를 지원합니다.
- Bedrock AgentCore Runtime을 이용해 실제 에이전트 구축 사례를 제시했습니다.
서론
2026년 10월 5일, Amazon Nova 2.5 Sonic이 Amazon Bedrock에서 일반 제공되었고[1], 같은 시기에 Strands Agents의 Bidi Agents도 일반 제공되었습니다[2]. Nova 2.5 Sonic은 음성을 듣고 음성으로 응답하는 speech-to-speech 모델이며, Bidi Agents는 이러한 양방향 스트리밍(bidirectional streaming) 모델과 대화를 계속할 수 있도록 Strands Agents 기능이 구현된 것입니다. 둘 다 도쿄 리전에서 사용할 수 있습니다.
본 기사에서는 먼저 Nova 2.5 Sonic이 어떤 모델인지, 그리고 Bedrock에서 어떻게 호출하는지 짧은 Python 코드로 확인합니다. 다음으로 Strands Agents의 BidiAgent로 무엇을 할 수 있는지 정리하고, 사용 사례로서 브라우저 마이크에 말하면 웹을 검색하여 음성으로 답변하는 에이전트를 Amazon Bedrock AgentCore Runtime에 올려 만들어 보았습니다.
Amazon Nova 2.5 Sonic이란?
speech-to-speech 모델
음성으로 대화하는 AI는 지금까지 오디오를 텍스트로 변환하는 음성 인식(Speech Recognition), 텍스트로 추론하는 LLM, 텍스트를 음성으로 변환하는 음성 합성(Text-to-Speech)의 세 가지를 연결하는 구성이 주류였습니다. Nova Sonic은 이 세 가지를 하나의 모델에서 처리하는 소위 speech-to-speech 모델입니다. 음성을 그대로 이해하고 음성을 그대로 생성하기 때문에, 중간에 텍스트로 변환하는 과정에서는 손실될 수 있는 목소리의 톤이나 간격 같은 정보를 이해와 응답 모두에 사용할 수 있습니다[3]. 초기 Nova Sonic이 2025년 4월, Nova 2 Sonic이 2025년 12월 공개되었으며, Nova 2.5 Sonic은 그 세 번째 세대에 해당합니다.
공식 발표에 따르면, Nova 2.5 Sonic에서는 추론(inference), 지시 사항 준수(instruction following), 도구 호출(tool calling)의 정확도가 개선되었고 레이턴시도 낮아졌습니다[1:1]. Nova 2 Sonic으로부터 계승된 기능으로는 7개 언어에 대응하는 표현력 있는 음성, 턴 감지 민감도 조정, 같은 세션 내에서의 음성과 텍스트 혼합 처리, 도구를 호출하는 동안에도 대화를 계속할 수 있는 비동기 도구 호출, 그리고 256K 토큰의 컨텍스트 창이 있습니다. tiffany와 matthew 두 목소리는 모든 대응 언어를 구사할 수 있는 polyglot 음성으로, 대화 중간에 언어가 바뀌어도 같은 목소리로 응답할 수 있습니다[4]. 사용 가능한 리전은 버지니아 북부(Virginia North), 오리건(Oregon), 스톡홀름(Stockholm), 도쿄이며, 비용은 Nova 2 Sonic과 동일합니다. 모델 ID는 amazon.nova-2-5-sonic으로, 기존의 -v1:0 같은 접미사는 붙지 않습니다.
음성 에이전트를 만드는 입장에서 본 세 가지 연결 구성과 speech-to-speech의 차이점입니다.
| 관점 | 음성 인식 + LLM + 음성 합성 | speech-to-speech (Nova 2.5 Sonic) |
|---|---|---|
| 응답까지 걸리는 시간 | 세 가지 처리 시간의 합계가 됨 | 하나의 모델이 스트리밍으로 반환함 |
| ... |
Strands의 Bidi Agents 발표 기사에서도 현재 많은 음성 에이전트들이 음성 인식을 거치는 구성이며, 디버깅이나 평가의 용이성을 얻는 대신 대화스러움을 잃고 있다고 언급되어 있습니다[2:1]. 어느 쪽이 더 좋은지는 사용 사례에 따라 다르지만, Nova 2.5 Sonic은 후자(speech-to-speech)를 Bedrock의 관리형 모델로 선택할 수 있게 해줍니다.
양방향 스트리밍 API
Nova 2.5 Sonic은 Bedrock의 InvokeModelWithBidirectionalStream API로 사용됩니다[5]. 일반적인 Converse나 InvokeModel처럼 요청을 보내고 응답을 기다리는 방식이 아니라, 하나의 HTTP/2 연결 위에서 클라이언트로부터의 이벤트와 모델로부터의 이벤트를 동시에 계속 스트리밍합니다. 클라이언트는 마이크 음성을 약 32밀리초 간격의 프레임으로 계속 보내고, 모델은 문자 변환(transcription), 응답 음성, 도구 호출을 이벤트로 반환합니다.
보내는 쪽 이벤트에는 순서가 있습니다. sessionStart로 온도 등의 추론 설정과 턴 감지 민감도를 결정하고, promptStart
출력 음성 형식과 목소리, 사용할 도구를 선언한 후에는 contentStart
그리고 contentEnd
로 감싼 내용을 전송합니다. 시스템 프롬프트는 텍스트의 content, 마이크 음성은 audioInput
을 반복하는 content, 도구 실행 결과는 toolResult
의 content입니다. 대화를 끝낼 때는 promptEnd
과 sessionEnd
을 보냅니다.
{"event": {"promptStart": {
"promptName": "...",
"audioOutputConfiguration": {"mediaType": "audio/lpcm", "sampleRateHertz": 24000,
...
목소리는 promptStart
의 voiceId,
턴 감지 민감도는 sessionStart
의 turnDetectionConfiguration.endpointingSensitivity
(HIGH / MEDIUM / LOW),
음성 세션 중 텍스트 입력은 interactive: true
을 붙인 텍스트의 contentStart,
도구는 promptStart
의 toolConfiguration
과, 모델로부터 도착하는 toolUse
이벤트에 대한 toolResult
의 반송입니다. 받는 쪽은, 문자 기록의 textOutput
, base64로 된 PCM이 들어간 audioOutput
, toolUse
, 그리고 content의 끝맺음을 나타내는 contentEnd
의 stopReason
이 중심이며, stopReason
이 INTERRUPTED라면 사용자가 끼어들었음을 의미합니다.
이 이벤트 열을 직접 구성하면, 음성 전송과 수신을 동시에 구동하는 비동기 처리, 식별자 관리, 도구 결과 반송, 8분 연결 상한에 대한 대처를 모두 작성해야 합니다. 이는 Nova의 사용자 가이드에 있는 최소 샘플로도 300줄을 초과합니다[6]. 또한, boto3는 이 API를 다룰 수 없으므로, 새로운 AWS SDK for Python의 aws-sdk-bedrock-runtime
패키지를 HTTP/2 양방향 스트림에 대응하는 CRT의 HTTP 클라이언트와 함께 사용해야 합니다[7]. 따라서 다음 절부터는 이 부분을 Strands Agents에게 맡깁니다.
실행해 보기
로컬 Python에서 Nova 2.5 Sonic을 구동합니다. Strands Agents를 양방향 스트리밍, 터미널 표시, 마이크와 스피커의 세 가지 추가 기능을 포함하여 사용합니다. 마이크와 스피커는 PyAudio를 통해 사용하므로, macOS에서는 먼저 brew install portaudio
가 필요합니다. AWS 인증 정보와 AWS_DEFAULT_REGION=ap-northeast-1
을 설정하고, Bedrock의 모델 접근에서 Nova 2.5 Sonic을 활성화해 둡니다. Python은 3.12 이상입니다.
pip install "strands-agents[bidi,bidi-io,bidi-pyaudio]"
마이크로 말하기
import asyncio
from strands.bidi import BidiAgent
from strands.bidi.io import AudioIO
...
실행하면 터미널에 Speak…이 표시되고, 마이크에 말하면 목소리로 응답합니다. 문자 기록과 도구 호출은 터미널에도 표시됩니다. 말하는 도중에 끼어들면, 에이전트는 말을 잇던 음성을 버리고 새로운 발화에 응답합니다. 스피커로 재생할 경우 에이전트가 자신의 목소리를 듣고 자신을 가리는 경우가 있으므로, 그럴 때는 AudioIO(audio_processor=True)
로 설정하여 재생되는 음성을 마이크 입력에서 빼주는 에코 캔슬링을 활성화합니다.
텍스트로 말 걸기
Nova 2.5 Sonic은 같은 세션에서 음성과 텍스트를 혼합할 수 있으므로, 마이크가 없는 환경에서도 시도해 볼 수 있습니다. agent.send()
문자열을 전달하면 사용자 발화로 취급되어 음성으로 반환됩니다. 반환된 음성은 PCM의 base64 형태이므로, 모아서 WAV 파일로 저장하면 로컬에서 들을 수 있습니다.
model = BedrockNovaSonicModel(model_id="amazon.nova-2-5-sonic", voice="tiffany",
audio={"output": {"sample_rate": 24000}})
pcm = bytearray()
...
assistant: 일본에서 가장 높은 산은 후지산입니다. 고도는 삼천칠백칠십육 미터입니다.
saved reply_tiffany.wav (5.7s)
open_audio_stream()
은 32밀리초의 무음 프레임을 몇 번 agent.send()하는 것만으로 되는 작은 함수입니다. Nova 2.5 Sonic의 텍스트 입력은 음성 세션 중에 문자로 끼어들 수 있는 기능으로 설계되었기 때문에, 음성 입력 스트림이 열려 있지 않은 상태에서 텍스트만 보내도 응답이 오지 않고 55초 후에 "audio bytes or interactive content를 기다리다 시간 초과"라는 오류로 연결이 끊깁니다 (처음에는 이 점을 인지하지 못해서 아무것도 돌아오지 않는 원인을 한동안 찾았습니다). 마이크를 사용하는 구성에서는 신경 쓰지 않아도 되는 부분이지만, 텍스트로 대화를 시작하고 싶거나 처음에 인사말을 말하게 하고 싶을 때는 무음을 조금 흘려준 다음 보냅니다.
도구 전달하기
도구는 일반적인 Strands Agents와 동일하며, @tool를 붙인 Python 함수를 tools에 전달하기만 하면 됩니다. docstring이 도구 설명으로 모델에 전달됩니다.
@tool
def get_current_time() -> str:
"""현재 일본 시간을 반환합니다. '지금 몇 시', '오늘은 며칠'이라고 물으면 호출합니다."""
...
tool: [('get_current_time', {})]
assistant: 현재는 이천이십육년 십월 칠일 십칠시 사십육분입니다.
모델이 toolUse 이벤트를 반환하면, BidiAgent가 함수를 실행하여 결과를 toolResult로 되돌려주고, 모델이 그 결과를 바탕으로 말합니다. Nova 2.5 Sonic의 도구 호출은 비동기적이며, 도구 실행 중에도 사용자 발화를 받을 수 있으므로 시간이 오래 걸리는 도구라도 대화가 멈추지 않습니다. MCP 서버의 도구도 일반적인 Strands Agents와 마찬가지로 MCPClient를 통해 동일한 tools에 전달할 수 있습니다.
목소리 변경하기
목소리는 BedrockNovaSonicModel(voice=...)에서 지정합니다. 공식 문서 목록에서는 영어(미국・영국・호주・인도), 프랑스어, 이탈리아어, 독일어, 스페인어, 포르투갈어, 힌디어 각각에 대해 여성 및 남성 목소리가 준비되어 있으며, tiffany와 matthew는 모든 언어를 구사할 수 있는 polyglot한 목소리입니다[4:1]. 일본어는 공식 지원 언어에는 포함되어 있지 않지만, 이번에 시도해 본 범위에서는 tiffany, matthew, amy 모두 일본어로 듣고, 일본어로 말했습니다.
model = BedrockNovaSonicModel(model_id="amazon.nova-2-5-sonic", voice="matthew")
턴 감지 민감도와 같은 Nova 고유 설정은 params에 sessionStart로 전달됩니다. 예를 들어 `params={
클래스가 가지는 도구(tool), MCP, 후크(hook), 세션 관리, 멀티 에이전트의 구성 요소를 조합하여 에이전트를 만듭니다. 모델 프로바이더는 Bedrock 외에도 Anthropic, OpenAI, Gemini 등을 전환할 수 있습니다. 멀티 에이전트의 구현 방식은 이전 기사에서 정리했습니다.
BidiAgent
일반적인 Agent는 입력을 전달하고 응답이 돌아올 때까지를 한 번의 호출로 처리합니다. 하지만 음성 대화에서는 이 형태가 성립되지 않습니다. 사용자가 말하는 도중에 모델은 계속해서 음성을 수신하고, 모델이 말하는 도중에 사용자도 끼어들 수 있으며, 도구가 실행되는 동안에도 대화는 지속되기 때문입니다. BidiAgent는 이러한 지속적인 양방향 상호작용을 위해 만들어진 에이전트로, 실시간 모델과의 연결을 대화 내내 유지하며 입력을 계속 보내고 출력을 받고, 도구를 백그라운드에서 실행합니다[9]. 2026년 10월 1일의 1.57.2 버전부터 실험적 API에서 정식 API가 되었으며, strands.bidi 패키지에서 사용할 수 있습니다.
| 관점 | Agent | BidiAgent |
|---|---|---|
| 호출 | agent("...")로 1회 왕복 | run() 또는 send() / receive()로 대화가 지속되는 동안 계속 작동 |
| 모델과의 연결 | 호출마다 | 대화 내내 영속적인 연결을 유지합니다. 상한에 도달하기 전에 교체합니다 |
| 입출력 | 텍스트와 이미지, 구조화된 출력 | 음성・텍스트・이미지 입력 스트림과, 음성・음성 인식(transcription)・텍스트 출력 이벤트 |
| 도구 실행 | 루프 내에서 순차적 | 대화와 병렬로 실행하며, 결과가 나오면 모델에 전달함 |
| ... | ||
BidiAgent가 내부적으로 처리하는 것은 Nova 2.5 Sonic을 직접 사용할 경우 사용자가 직접 작성해야 하는 처리 목록이기도 합니다. 이전 절에서 본 이벤트 리스트의 순서 관리 및 식별자 관리, 음성 송수신 동시 작동 비동기 처리, 음성 인식 조립(assembly), 도구 병렬 실행과 toolResult 반환, 8분 연결 상한 전에 연결을 교체하고 히스토리를 재전송하는 처리, OpenTelemetry의 스팬 출력, 세션 스냅샷이 BidiAgent 안에 포함되어 있습니다. 연결 교체는 기본적으로 7분 후에 이루어지며, 이번에 45초로 단축하여 테스트했을 때, 교체 10초 전에 경고 이벤트가 발생했고, 교체 후 |
브라우저는 Amazon CloudFront를 통해 Amazon S3에 배치된 React 앱을 로드하고, Amazon Cognito의 사인인 화면에서 권한 코드 플로우(authorization code flow)를 통해 액세스 토큰을 받습니다. 대화를 시작하면 브라우저는 Amazon Bedrock AgentCore Runtime의 WebSocket 엔드포인트에 직접 연결됩니다. AgentCore Runtime은 에이전트 코드를 세션별로 분리된 환경에서 실행하는 호스팅 서비스이며, HTTP 호출 외에도 WebSocket을 통한 양방향 스트리밍을 지원하여 클라이언트는 SigV4 또는 OAuth 토큰으로 인증합니다[11]. Runtime 위에서는 이전 절의 BidiAgent가 작동하며, 브라우저에서 들어오는 음성을 Nova 2.5 Sonic에 전달하고 응답 음성과 자막을 브라우저로 반환합니다.
웹 검색은 AgentCore Gateway에서 구현합니다. AgentCore Gateway는 Lambda 함수나 REST API를 MCP의 도구로 공개하는 서비스이며, Amazon이 운영하는 웹 인덱스를 검색하는 웹 검색 도구를 커넥터로 추가할 수 있습니다[12]. Gateway는 IAM 인증을 사용하여 Runtime의 실행 역할(execution role)로부터 SigV4로 호출합니다. 검색 문의는 AWS 외부로 나가지 않으며, 결과에는 제목과 URL이 붙기 때문에 화면에 출처로 표시됩니다.
API Gateway나 Lambda를 사용하지 않았습니다. Lambda는 한 번의 호출로 완료되는 실행 모델이기 때문에, Nova와의 양방향 스트림을 유지하면서 브라우저와 지속적으로 음성을 주고받는 처리에 적합하지 않아 대신 AgentCore Runtime의 세션에 그 역할을 부여했습니다. 브라우저에서 Runtime으로 직접 연결하는 구성을 취함으로써, 음성 경로에는 브라우저와 Runtime 간의 WebSocket이 단 하나만 존재합니다.
1. AgentCore Runtime의 WebSocket 핸들러
Runtime용 SDK인 bedrock-agentcore의 @app.websocket에서 /ws 핸들러를 정의하고, 연결마다 BidiAgent를 생성합니다. 브라우저와의 통신은 JSON 텍스트 프레임으로 이루어지며, 브라우저에서는 16kHz의 PCM을 base64로 인코딩한 audio와 텍스트의 text, 에이전트 측에서는 24kHz의 PCM audio, 자막(transcript), 도구 호출 및 결과, 중단 알림을 전송합니다. BidiAgent의 입출력 스트림은 WebSocket에서 메시지 하나를 읽어 입력으로 변환하는 함수와, 이벤트를 하나 받아 JSON으로 보내는 함수로 작성하기만 하면 됩니다.
@app.websocket
async def voice_session(websocket, context):
await websocket.accept()
...
Runtime에 배포할 때는 컨테이너가 아닌, 의존성별로 zip으로 만든 직접 코드 배포 방식을 사용했습니다. 문서의 WebSocket 설명은 컨테이너를 전제로 작성되어 있지만, zip 방식에서도 /ws는 작동했습니다. 이 zip 파일은 35MB이며 Docker나 ECR이 필요 없습니다.
2. 브라우저에서의 연결 및 인증
브라우저의 WebSocket API는 핸드셰이크에 헤더를 추가할 수 없기 때문에, AgentCore Runtime은 Bearer 토큰을 서브프로토콜(subprotocol)로 받는 방법을 준비했습니다[11:1]. Cognito의 액세스 토큰을 base64url로 인코딩하여 Sec-WebSocket-Protocol에 base64UrlBearerAuthorization.<token> 형태로 포함시키고, Runtime 측에서는 Cognito의 사용자 풀(user pool)을 JWT 검증 대상으로 설정합니다. Runtime의 JWT 인증 과정에서는 허용하는 클라이언트 ID에 SPA용 애플리케이션 클라이언트를 지정함으로써, Cognito의 액세스 토큰이 그대로 통과했습니다.
마이크의 음성은 AudioWorklet을 사용하여 16kHz PCM으로 변환하고, 64밀리초마다 전송합니다. 수신된 음성은 Web Audio의 AudioBufferSourceNode를 이전 청크 끝에 예약하여 끊김 없이 재생하며, barge_in이 도착하면 예약된 모든 재생을 중단시킵니다. 음성 생성은 실시간의 약 6배 속도이므로, 재생 대기 음성을 폐기하는 처리가 없으면 가로채기(interruption) 후에도 오래된 답변이 계속 흘러나옵니다.
3. Gateway의 Web Search 도구
Gateway는 커넥터 ID web-search를 타겟으로 하나 가지며, WebSearch라는 도구를 공개합니다. 에이전트 측에서는 Strands의 MCPClient에 Gateway의 URL과 SigV4로 서명할 httpx.Auth만 전달하면, list_tools_sync()의 결과를 그대로 tools에 전달할 수 있습니다. SigV4 서명은 MCP Proxy for AWS 라이브러리로 충분했을 것 같았지만, Strands의 양방향 스트리밍이 의존하는 awscrt 버전과 충돌하여 공존할 수 없었기 때문에, boto3의 SigV4Auth를 사용하는 30줄 정도의 httpx.Auth를 작성했습니다.
4. 대화의 마무리 방식
'さようなら(안녕)'로 대화를 끝내기 위해 end_conversation이라는 도구를 전달합니다. BidiAgent에는 agent.cancel()로 대화를 중지하는 메커니즘이 있지만, 도구 내부에서 호출하면 도구 완료 직후에 대화가 멈추어 작별 인사 음성이 중간에 끊겼습니다. 그래서 도구 자체는 아무것도 하지 않게 하고, 도구 결과가 반환된 후의 응답이 끝나는 시점에서 서버 측에서 WebSocket을 닫도록 했습니다. 브라우저는 수신한 음성을 다 재생하고 나서 멈추기 때문에, '저도 감사했습니다, 또 만나요'까지 들립니다.
직접 작동시켜 본 결과
작동하는 모습은 이렇습니다.

그림 2: 동작 모습
음성을 넣을 수 없는 것이 아쉽지만, 현장감은 전달되나요??
이 GIF는 특히 빠르게 감기 같은 것은 하지 않았고, 정말 이 속도로 대화할 수 있습니다. 특히 검색 같은 것은 상상 이상의 고속성에 놀랐습니다. 거의 끊김 없이 최신 정보를 검색한 내용을 바탕으로 답변할 수 있어서 스트레스가 없습니다. 실측값으로는, 말을 마치고 첫 응답 음성이 도착하기까지는 도구를 사용하지 않는 질문의 경우 0.60.9초 정도, 웹 검색을 동반하는 질문의 경우 1.92.3초 정도였습니다. 웹 검색 자체는 0.4~0.5초 만에 돌아옵니다. 대화 중에는 실제로 '오늘 도쿄 날씨를 조사해줘'라고 말하면, 시스템 프롬프트에 넣은 날짜를 사용해서 '2026년 10월 8일 도쿄 날씨'로 검색하고, 'Yahoo 날씨에 따르면, 오늘 도쿄는 맑고 최고 기온은 스물다섯도...'와 출처를 언급하며 답변합니다. 이어서 AWS의 최근 발표를 물어보면 검색 결과를 바탕으로 이야기하고, 그 내용을 다시 듣고 질문하면 이전 문맥을 고려하여 답했습니다. 화면의 '응답까지' 초는 사용자의 텍스트 변환이 확정된 후 첫 음성이 도착하기까지의 시간이므로, 말을 마치고 측정한 위의 수치보다 짧게 나옵니다.
연결 부분에서는 AgentCore Runtime의 세션별 시작 시간이 눈에 띕니다. 기본 플랫폼 V1에서는 '대화 시작'을 누르고 말할 수 있을 때까지 67초가 걸렸습니다. 이미 실행된 환경의 스냅샷에서 복원하는 V2로 전환하니 23초가 됩니다. V2는 도쿄에서도 사용할 수 있지만, 기사 작성 시점의 Terraform AWS Provider와 AWS CLI로는 지정할 수 없었기 때문에, boto3의 update_agent_runtime으로 전환했습니다.
요금은 공식 발표에서는 Nova 2 Sonic과 동일하다고 되어 있으며, Price List API로 얻을 수 있는 도쿄 단가는 음성 입력이 1,000 토큰당 $0.0037, 음성 출력이 $0.0150, 텍스트 입력이 $0.0004, 텍스트 출력이 $0.0033입니다[13]. 마이크의 음성은 무음일 때도 1초당 약 17 토큰을 소모하므로, 듣기만 하는 상태가 1분당 약 $0.004 정도 걸립니다. 왕복 4회 정도의 1분간 대화로 $0.015 전후이며, 웹 검색은 쿼리마다 Gateway 측 요금이 별도로 발생합니다.
일본어의 경우, 문장으로 답변하는 범위에서는 듣기(Speech Recognition)와 말하기(Speech Synthesis) 모두 어느 정도 실용적이었습니다. 약간 영어와 중국어가 섞인 듯한 악센트가 있는 느낌도 있지만, 원어민 일본인이 알아듣지 못할 일은 없을 것이라고 생각합니다. 합성 음성으로 재생된 '350엔짜리 상품을 네 개 사면 총액은 얼마' 같은 문장은 정확하게 전사(transcription)되었고, '에이다브이에스람다'는 AWS의 Lambda로 해석되었습니다. 반면에 도도부현이나 요일과 같은 고유명사의 경우, 전사는 가능했지만 음성이 일부 끊기는 현상도 있었습니다. 사용 사례가 제한적일 수는 있지만, 이전 Amazon Nova 2 Sonic보다 확실히 발전했다는 것을 알 수 있습니다.
요약
Nova 2.5 Sonic과 Strands Agents를 이용해 브라우저에서 음성으로 말하며 웹을 검색하는 에이전트를 만들어 보았습니다. Nova 2.5 Sonic은 양방향 스트리밍 API(bidirectional streaming API) 위에서 음성 이해와 생성을 하나의 모델로 처리하며, BidiAgent가 이 이벤트 목록의 관리, 도구의 병렬 실행, 연결 전환 등을 내부적으로 수행하기 때문에 에이전트 본체는 수십 줄로 작성할 수 있습니다. 호스팅은 AgentCore Runtime의 WebSocket을 사용하고, 도구는 AgentCore Gateway를, 인증은 Cognito를 사용하여 음성 경로까지 서버리스(serverless)로 구성할 수 있었습니다. 이번에는 구현하지 않았지만, AgentCore Memory를 이용해 과거 대화를 기억하게 하거나, Gateway에 자체 API 타겟을 추가하여 주문 조회나 예약과 같은 업무 처리를 음성으로 할 수 있도록 발전시킬 수 있을 것으로 생각됩니다.
AI 자동 생성 콘텐츠
본 콘텐츠는 Zenn AI의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기