TensorSharp Jev 요청으로 문서, 이미지, 비디오, 오디오 결합 가능
요약
TensorSharp의 Jev 엔드포인트가 확장되어 하나의 의사 결정(decision) 요청에 문서, 이미지, 비디오, 오디오 등 다양한 형태의 증거를 결합하여 사용할 수 있게 되었습니다. 이 기능을 통해 인시던트 트리아지 같은 복잡한 상황 분석이 가능해졌으며, Base64 인라인 전송 및 파일 참조 방식을 모두 지원합니다.
핵심 포인트
- 다양한 미디어(문서, 이미지, 비디오, 오디오)를 하나의 요청에 결합하여 사용 가능
- Base64 인라인 전송과 별도의 업로드 API/파일 참조 방식 모두 지원
- 비디오는 프레임으로 샘플링되고, 오디오는 별도 음성 인식 서비스로 전사됨
- 대용량 미디어의 경우 파일 참조 방식을 사용하는 것이 권장됨
TensorSharp의 Jev 호환 /v1/systemone 엔드포인트를 확장하여 하나의 의사 결정(decision) 요청이 여러 종류의 증거를 함께 사용할 수 있게 되었습니다. 예를 들어, 인시던트 트리아지(incident triage) 요청에 작성된 보고서, 대시보드 스크린샷, 화면 녹화 영상, 그리고 통화자의 오디오 클립을 포함할 수 있습니다. 다음은 이 네 가지를 모두 인라인 Base64 데이터로 전송하는 Python 예제입니다. 또한 메모리에 이미 존재하는 텍스트와 파일에서 바이트를 읽어오는 두 가지 방법도 보여줍니다.
import base64
import json
from pathlib import Path
from urllib.request import Request, urlopen
def encode_bytes(data: bytes) -> str: return base64.b64encode(data).decode("ascii")
def encode_file(path: str) -> dict: file = Path(path) return {"name": file.name, "data": encode_bytes(file.read_bytes())}
# 메모리에 이미 존재하는 데이터를 이름이 지정된 텍스트 첨부 파일로 인코딩합니다.
notes = "Customers report HTTP 503 errors and cannot sign in."
text_attachment = { "name": "incident.txt", "data": encode_bytes(notes.encode("utf-8")), }
body = { "model": "jev-latest", "state": "Assess the incident using the attached evidence.", "files": [
text_attachment,
encode_file("dashboard.png"),
encode_file("screen-recording.mp4"),
encode_file("caller.wav"),
], "questions": { "active_outage": { "type": "noul", "instructions": "Does the evidence indicate an active service outage?", }, "team": { "type": "choice", "instructions": "Which team should investigate first?", "criteria": { "technical": "Service errors or an unavailable application", "billing": "Charges or subscription problems", "other": "Neither of the above", }, }, }, "samples": 1, "seed": 42, }
request = Request(" http://127.0.0.1:5000/v1/systemone ", data=json.dumps(body).encode("utf-8"), headers={\
인라인 첨부 파일은 이름이 필요하며, 위에서 설명한 바와 같이 순수 Base64 또는 Base64 데이터: URL을 허용합니다. 이것이 어떻게 작동하는지에 대한 상세 내용은 다음과 같습니다. 비디오는 비전 타워(vision tower)를 위해 프레임으로 샘플링되고; 오디오는 별도로 구성된 음성 인식 서비스에 의해 전사됩니다. DiffusionGemma는 오디오 파형을 직접 처리하지 않습니다. 이미지와 비디오 입력에는 비전 타워가 필요하며, 오디오 입력에는 TS_JEV_TRANSCRIPTION_URL이 구성되어야 합니다. 인라인 Base64는 Jev 요청 본문 제한(기본값 8 MiB)에 포함되므로, 더 큰 미디어의 경우 업로드 API와 파일 참조를 사용하십시오. 해당 레포지토리에는 바로 전송할 수 있는 혼합 미디어 요청도 있습니다. TensorSharp: https://github.com/zhongkaifu/TensorSharp 저는 단일 요청에서 여러 미디어 유형으로부터 어떤 종류의 결정을 내리고 싶으신지 궁금합니다. /u/fuzhongkai가 r/LocalLLaMA에 제출함 [링크] [댓글]
AI 자동 생성 콘텐츠
본 콘텐츠는 r/OpenAI Codex (search)의 원문을 AI가 자동으로 요약·번역·분석한 것입니다. 원 저작권은 원저작자에게 있으며, 정확한 내용은 반드시 원문을 확인해 주세요.
원문 바로가기