주말 아침 - 주간 AI #39

이번 주 AI 소식은 모델 자체보다 에이전트를 실제 시스템으로 운영하는 방법에 초점을 맞춥니다. MCP의 차기 로드맵과 Anthropic의 Model Hardware Standard는 소프트웨어·물리 장치의 공통 연결 규격을 넓히고, Gemini Omni 1.1 Flash와 Granite 4.2는 영상 생성과 오픈 에이전트 모델의 실용 범위를 확장했습니다. Visual Studio BYOM, Foundry Hosted Agents, Agent Framework 채널은 배포 경로를 구체화했으며, GraphRAG·운영 평가·Agent Hooks·소형 특화 모델 논의는 신뢰할 데이터, 측정 가능한 품질, 검증 가능한 통제가 자율성보다 먼저라는 메시지를 전합니다.

:sunrise: 주말 아침 AI #39

:fire: 주요 뉴스

MCP, 에이전트 메시징·신원·점진적 도구 탐색을 차기 핵심 과제로 선정

MCP 핵심 유지관리자들은 다음 사양 릴리스 이후의 다섯 우선순위로 에이전트 메시징, HTTP 전송 통합, 에이전트 신원과 기업 보안, 기본 프리미티브 개선, SDK 개발 경험을 제시했습니다. 2026-07-28 사양에서 세션과 초기화 핸드셰이크를 없애 수평 확장을 단순화한 데 이어, 서버 이벤트·작업 조정·Workload Identity Federation·점진적 도구 탐색을 발전시킬 계획입니다. 이는 확정 기능 발표가 아니라 향후 사양 작업의 로드맵입니다.

LiteLLM·RAGFlow·Kestra 침해가 드러낸 AI 인프라의 새로운 공격면

Microsoft Security는 LiteLLM 게이트웨이, RAGFlow 검색 플랫폼, Kestra 워크플로 환경을 노린 실제 침해 세 사례에서 자격 증명 탈취, 지속성 확보, 암호화폐 채굴이라는 공통 목표를 관측했습니다. LiteLLM에서는 프로세스 환경과 PostgreSQL의 모델·가상 키가 수집됐고, RAGFlow에는 새 LLM 공급자 키를 가로채는 훅이 삽입됐으며, Kestra에서는 Docker 소켓 탐색과 XMRig 실행이 이어졌습니다. 관리면 인터넷 노출 차단, 팀별 제한 키, 관리형 비밀 저장소, 기본 거부 아웃바운드 정책을 권고합니다.

Claude, 채팅과 Cowork를 잇는 통합 메모리와 사용자 편집 기능 제공

Anthropic은 Claude 채팅과 Cowork가 하나의 메모리를 공유하도록 바꾸고, 대화 중 주제별 기억을 갱신해 다음 작업에 바로 반영한다고 밝혔습니다. 사용자는 설정에서 각 기억 파일을 읽고 수정하거나 삭제할 수 있습니다. Free·Pro·Max에서는 웹·데스크톱·모바일에 기본 활성화되지만, Team·Enterprise는 관리자가 허용한 뒤 개인이 켜야 하며 건강·정치 등 민감 주제 저장은 별도 선택 ■■지 꺼져 있습니다.

Gemini Omni 1.1 Flash, 40초 장면 확장과 4K 업스케일링을 API로 제공

Google은 영상 생성 모델 Gemini Omni 1.1 Flash를 Gemini API와 AI Studio에 출시했습니다. 이전 영상 문맥을 최대 10초 분석해 10초 단위로 누적 40초까지 장면을 확장하고, 시작·종료 프레임 보간과 최대 3초짜리 참조 영상 입력, 1080p·4K 업스케일링을 지원합니다. 360p 초안은 720p보다 최대 60% 빠르고 비용은 3분의 1이라는 회사 측 설명이며, Google Flow와 Gemini 앱에도 대상 구독자에게 전 세계 제공됩니다.

Anthropic, AI 에이전트가 물리 장치를 다루는 Model Hardware Standard 연구 프리뷰

Model Hardware Standard(MHS)는 현미경·액체 처리기·로봇 팔처럼 서로 다른 장치를 공통 read/write 프리미티브와 자연어 메타데이터로 설명하고 MCP·CLI·코드에서 제어하게 하는 모델 중립 규격입니다. Anthropic은 통상 수주~수개월 걸리던 통합을 수시간~수분으로 줄였고 QuEra 실험에서는 레이저 잠금을 사람 개입 없이 99.3% 복구했다고 보고했습니다. 아직 오픈소스가 아닌 대기자 대상 연구 프리뷰이며, 프로그래밍 인터페이스가 없는 장치는 지원하지 않고 물리 추론에는 전문가 감독이 필요합니다.

:rocket: 새로운 도구/서비스

Visual Studio 18.10 Insiders, Agent 모드에 BYOM 프리뷰 도입

Visual Studio의 Bring Your Own Model 프리뷰는 Community·Professional·Enterprise에서 기본 활성화되며, GitHub 로그인 여부와 관계없이 Agent 모드에 Microsoft Foundry, OpenAI, Anthropic, Ollama 모델을 연결할 수 있습니다. 현재는 Visual Studio 18.10 Insiders와 새 Agent 프리뷰가 필요하고 기존 Ask·Agent 모드의 BYOM 설정은 다시 추가해야 합니다. 모든 모델 조합이 모든 에이전트 기능을 지원하는 것은 아니며, 중앙 관리와 비활성화 정책은 향후 18.10 GA 이후 기능입니다.

C# 에이전트를 1개 패키지·3줄 코드로 Foundry Hosted Agent에 배포

Microsoft의 예제는 기존 Agent Framework 앱에 Microsoft.Agents.AI.Foundry.Hosting 패키지와 호스트·Responses 등록 3줄을 추가하고 azd provision, azd deploy로 배포합니다. Hosted Agents 서비스는 GA이며 세션별 컴퓨팅, 영속 상태, Entra ID, OpenAI 호환 엔드포인트, 추적·평가·버전을 관리하고 15분 유휴 후 컴퓨팅을 해제합니다. 다만 글 작성 시점의 .NET 호스팅 통합 패키지는 프리릴리스이고 Azure 리소스 비용이 발생합니다.

Microsoft Agent Framework, 하나의 에이전트를 Responses·Telegram·A2A·MCP에 연결

Python용 Agent Framework 호스팅 패키지는 OpenAI Responses, Telegram, A2A, MCP를 채널별 어댑터로 제공해 같은 에이전트나 워크플로를 여러 인터페이스에 노출합니다. 공통 AgentState와 WorkflowState가 대상과 세션 상태를 연결하지만, 사용자 신원과 세션 ID 매핑, 인증·권한, 저장소, 동시성, 배포는 애플리케이션이 직접 소유합니다. 즉 새 런타임에 앱을 가두기보다 기존 FastAPI·Django·Flask 같은 구조에 필요한 프로토콜 경계만 추가하는 방식입니다.

Ollama, Claude Desktop에서 로컬·클라우드 오픈 모델 전환 지원

Ollama 앱에서 Claude 연결을 켜면 Claude Desktop의 서드파티 게이트웨이가 자동 구성되고, Ollama의 로컬 모델과 클라우드 모델을 선택해 사용할 수 있습니다. 토글을 끄면 기존 Anthropic 설정으로 돌아갑니다. Ollama는 이 경로에서 텔레메트리가 기본 비활성화되고 자사 로컬·클라우드 서비스에 Zero Data Retention을 적용한다고 설명하지만, 실제 데이터 경로와 조직 정책은 배포 전 별도로 확인해야 합니다.

Microsoft Agent Harness, 관측·거버넌스·배포·평가를 하나의 에이전트 정의에 결합

Agent Harness 튜토리얼 마지막 편은 하나의 공유 에이전트 팩터리를 콘솔, Foundry 호스트, 평가 실행기가 함께 사용하게 해 구현 복제를 막습니다. OpenTelemetry로 모델·도구·토큰을 추적하고, 선택적으로 Purview 정책을 적용하며, 로컬 검사와 Foundry 모델 평가를 CI에 연결합니다. 호스팅 환경에서는 파일·셸 접근을 기본 차단하고 외부 파일 저장소를 권고하며, LocalCodeAct 자체는 샌드박스가 아니므로 격리된 컨테이너 안에서만 사용해야 한다고 명시합니다.

:books: 학습 자료

운영 투입 전 LLM 평가를 통합 테스트처럼 설계하는 여덟 가지 원칙

GitHub의 비밀 탐지 사례는 모델 점수보다 제품 의사결정, 안전 제약, 비용·지연·호환성 가드를 먼저 정의하라고 권합니다. 프롬프트·모델·데이터셋·파이프라인 버전을 고정하고 한 번에 큰 변수 하나만 바꾸며, 운영과 유사한 모호한 사례를 유지하고 오류를 모델·프롬프트·입력·파이프라인·데이터·라벨로 분류합니다. 이 방식으로 오프라인 데이터에서 오탐을 95% 줄이면서 재현율 가드를 지켰지만, 저자들은 이를 운영 성능의 완전한 증명으로 ■■ 않습니다.

Google ADK에서 음성 에이전트를 시뮬레이션·채점·회귀 테스트하는 법

ADK의 라이브 평가는 사용자 시뮬레이터가 Gemini TTS로 음성 턴을 생성하고, 실제 라이브 에이전트와 나눈 다중 턴 대화·도구 호출을 자연어 루브릭과 턴별 지표로 채점합니다. 예제는 세 에이전트가 신원과 생년월일을 확인한 뒤 예약 정보를 제공하며, 품질 임계값 0.7과 최대 10회 호출 제한을 둡니다. 같은 평가를 CLI와 AgentEvaluator에서 실행해 CI/CD 회귀 검사로 연결하고 ADK Web에서 전사문과 오디오를 함께 검토할 수 있습니다.

Granite 4.2의 15조 토큰 사전학습과 실환경 에이전트 강화학습 해부

IBM Granite 4.2는 Apache 2.0으로 공개된 3B·8B·30B 밀집형 추론 모델로, 약 15조 토큰의 5단계 사전학습과 720만 개 샘플 규모의 지도 미세조정을 거쳤습니다. 모든 모델은 사고·비사고·저비용 사고 모드와 OpenAI 형식 도구 호출을 지원하며, 8B와 30B는 실제 저장소·터미널·웹 검색 환경에서 결과 기반 보상을 받는 에이전트 강화학습을 추가했습니다. FP8·FP4·GGUF 양자화와 vLLM·SGLang·여러 코딩 하네스 연결법도 제공합니다.

에이전트용 데이터를 신뢰·문맥·추적·거버넌스·실행 가능하게 만드는 구조

Pramod Sadalage와 Prem Chandrasekaran은 사람이 암묵적으로 보완하던 판단을 데이터 계약, 신선도 SLA, 격리 구역, 의미 모델, 기능 모델, 관측성으로 명시해야 한다고 설명합니다. 원시 Bronze와 검증 중인 Silver가 아니라 인증된 Gold 이상만 에이전트에 노출하고, 검색 문서는 행동을 참고하게 할 뿐 권한을 부여하는 규칙으로 쓰지 말라고 권합니다. 505명 조사에서 87%가 데이터 준비를 확신했지만 43%는 여전히 이를 최대 장애물로 꼽은 간극도 소개합니다.

Microsoft GraphRAG의 로컬·글로벌 검색과 지식 그래프 구축 흐름 이해하기

GraphRAG는 문서를 청크로 나누는 데서 끝나지 않고 엔터티·관계·주장을 추출해 커뮤니티와 요약, 임베딩을 구성합니다. 특정 엔터티 질문에는 원문 청크와 그래프를 결합한 Local Search를, 전체 데이터의 주제와 경향에는 더 많은 계산이 드는 Global Search를 사용합니다. 인덱싱 과정에서 LLM 호출 비용이 커질 수 있으므로 전체 사내 지식부터 넣지 말고 작은 통제 데이터셋과 답해야 할 관계 질문을 먼저 정하라는 안내입니다.

:light_bulb: 인사이트

에이전트 비용은 토큰 단가가 아니라 성공한 결과 하나의 총비용으로 측정해야 한다

Microsoft는 한 결과가 여러 모델 호출과 도구 재시도로 이뤄지는 만큼 요청당 비용만 낮추면 오히려 전체 비용이 늘 수 있다고 지적합니다. 작업별 모델 라우팅과 배포 방식, 반복 접두어 캐싱, 프롬프트·에이전트 최적화, 관측·평가의 네 레버를 함께 측정해야 합니다. 비대화형 Batch 배포는 최대 50% 저렴하고 프로비저닝 환경의 캐시 읽기는 최대 100% 할인될 수 있지만, 모든 변경은 품질·안전·지연 가드를 통과해야 합니다.

자기개선 소프트웨어 팩토리는 설정을 코드화하고 점수와 실험으로 닫힌 루프를 만든다

Warp는 코딩 에이전트 운영을 factory.yaml, 에이전트·스킬·MCP·라우팅 규칙이 포함된 버전 관리 시스템으로 정의해야 한다고 주장합니다. PR 처리량, PR당 비용, 인간 개입률 같은 지표와 실행 추적을 모으고, scorer가 품질·효율을 평가한 뒤 개선 에이전트가 설정 변경을 PR로 제안하며 사람이 병합하는 구조입니다. 이는 Warp 제품 관점의 제안이며, 실제 개선 여부는 대표 작업을 여러 구성으로 병렬 실행하는 벤치마크로 독립 확인해야 합니다.

6개월간 에이전트만으로 코딩하며 얻은 결론, 구현보다 설계와 채택 판단이 더 중요해졌다

Maisem Ali는 직접 코드를 쓰지 않는 규칙 아래 한때 약 20개 격리 VM에서 에이전트를 병렬 운영했습니다. 일회용 환경, 읽기 중심 외부 권한, 프록시 주입 자격 증명, 실행 가능한 미리보기와 다중 리뷰를 갖췄지만 테스트와 화면이 모두 맞는 변경도 제품에 불필요하면 폐기했습니다. 반대로 구조를 이해하지 않고 만든 관리 도구 botd는 새 레거시가 되어 무너졌고, 저자는 코딩을 멈췄어도 아키텍처·계약·마이그레이션을 책임지는 엔지니어링은 더 중요해졌다고 결론 냅니다.

소형 특화 모델이 범용 대형 모델보다 나은 순간과 LoRA의 경제성

O’Reilly 글은 체스 엔진처럼 ■은 문제에 맞춘 시스템이 범용 LLM을 이길 수 있으며, 100억 파라미터 미만 모델은 비용·적응성·배포 유연성에서 에이전트 작업에 유리하다는 NVIDIA의 견해를 소개합니다. 4B 연구·터미널 모델과 2억5800만 파라미터부터 시작하는 문서 추출 모델을 사례로 들고, LoRA를 통해 전체 가중치를 다시 학습하지 않고도 휴대 가능한 어댑터를 만들 수 있다고 설명합니다. 초기 탐색에는 범용 모델이 편리하지만 문제가 안정되면 특화·자체 호스팅이 더 큰 통제력을 줄 수 있다는 주장입니다.

Agent Hooks, 프레임워크별 가드레일을 8개 지점과 재실행 가능한 적합성 검사로 통합

Microsoft Responsible AI 팀이 공개한 AGENT-HOOKS-0.1은 에이전트 시작부터 입력·모델·도구·출력·종료까지 8개 개입 지점에 allow·deny·transform 판정을 적용하는 프레임워크 중립 계약입니다. Python·TypeScript·.NET·Rust·Go SDK와 47개 시나리오 적합성 키트를 제공하며 Microsoft Agent Framework 코어 구현은 적용 가능한 47개를 모두 통과했다고 보고합니다. 다만 협력하는 호스트가 판정을 지킨다는 전제의 거버넌스 계약이지 샌드박스나 악성 호스트 방어선은 아닙니다.

2개의 좋아요