주말 아침 - 주간 AI #31

이번 주 AI 흐름은 "더 강한 모델"보다 "조직 안에서 믿고 맡길 수 있는 에이전트"에 초점이 맞춰졌습니다. Claude Sonnet 5, GitHub Copilot의 JetBrains 통합, Microsoft Frontier Company와 Claude의 Microsoft Foundry 정식 제공은 기업 개발 환경의 기본 레이어로 AI가 들어가고 있음을 보여줍니다. 동시에 Safari MCP 서버, MCP 2026-07-28 SDK 베타, Foundry-LangGraph A2A, ADK 2.0과 Genkit은 에이전트를 실제 앱과 워크플로에 붙이는 도구 체계를 넓히고 있습니다. 학습 쪽에서는 MCP 입문, Microsoft Agent Framework, Agent Harness, Terraform MCP, eval prompt가 실전 주제로 떠올랐고, 보안과 운영 관점에서는 acting agent, context debt, agent memory, benchmark blind spot, human handoff가 핵심 리스크로 정리됩니다.

:sunrise: 주말 아침 AI #31

:fire: 주요 뉴스

Claude Sonnet 5 공개

Anthropic은 Claude Sonnet 5를 도구 사용, 코딩, 지식 작업에 더 강한 Sonnet 계열 모델로 소개했습니다. 핵심은 Sonnet급 비용 구조에서 Opus급 에이전트 성능에 가까워지는 방향입니다. 개발팀 입장에서는 고가 모델만 맡기던 장기 작업과 터미널, 브라우저 사용을 더 넓은 업무에 적용할 수 있는지가 관전 포인트입니다.

GitHub Copilot, JetBrains IDE의 통합 에이전트로 제공

JetBrains와 GitHub의 협력으로 Copilot이 JetBrains IDE 안의 agent picker에 네이티브로 들어왔습니다. Copilot을 별도 플러그인처럼 호출하는 단계에서 벗어나, IntelliJ IDEA, Rider, PyCharm 같은 일상 개발 환경의 기본 에이전트 선택지로 다루겠다는 신호입니다.

Microsoft Frontier Company: 지능을 증폭하고 보호하는 AI engineering

Microsoft는 AI 도입이 실험 단계를 지나 측정 가능한 성과, 지식재산 보호, 업무 흐름 재설계로 옮겨가고 있다고 설명합니다. Frontier Company라는 표현은 단순한 Copilot 배포보다 조직의 지식, 보안, 개발 프로세스를 함께 바꾸는 AI engineering 접근을 강조합니다.

Claude, Microsoft Foundry에서 정식 제공

Anthropic은 Claude 모델을 Azure 기반 Microsoft Foundry에서 정식 제공한다고 밝혔습니다. 기업은 Claude를 쓰면서도 Azure 운영, 거버넌스, 배포 경계를 활용할 수 있습니다. 모델 선택이 API 하나를 고르는 문제가 아니라 클라우드 운영 체계와 맞물리는 단계로 들어갔습니다.

2026 Agent Confidence Index: 300명의 builder가 본 에이전트 모멘텀

Microsoft와 MIT Technology Review Insights는 기업 현장에서 에이전트가 어떤 워크플로에 신뢰를 얻고 있는지 조사했습니다. 에이전트 도입의 핵심 지표가 "멋진 데모"에서 "팀이 실제로 위임할 수 있는가"로 이동하고 있음을 보여줍니다.

:rocket: 새로운 도구/서비스

웹 개발자를 위한 Safari MCP 서버

Safari Technology Preview 247에 Safari MCP server가 들어왔습니다. MCP 호환 클라이언트가 실제 Safari 브라우저 창과 연결되어 렌더링 상태와 디버깅 정보를 볼 수 있게 됩니다. 웹 개발 에이전트가 코드만 읽는 것이 아니라 브라우저 결과까지 확인하는 방향입니다.

MCP 2026-07-28 스펙 RC용 SDK 베타 공개

MCP 팀은 Python, TypeScript, Go, C# SDK의 베타를 공개하며 2026-07-28 스펙 릴리스 후보 대응을 시작했습니다. 새 스펙은 stateless 흐름과 서버 확장성을 강조합니다. MCP 서버를 운영하는 팀은 지금부터 마이그레이션과 호환성 테스트를 준비해야 합니다.

Foundry와 LangGraph 에이전트를 A2A로 연결하기

Microsoft Foundry 에이전트가 Azure Container Apps에 올라간 LangGraph 에이전트를 호출하는 Agent-to-Agent 예제가 소개됐습니다. 멀티 에이전트 시스템은 같은 프레임워크 안에서만 움직이는 구조를 넘어, 서로 다른 런타임과 도구 체계를 어떻게 발견하고 호출할지가 중요해지고 있습니다.

Google ADK 2.0을 만든 이유

Google은 ADK 2.0에서 프로토타입 에이전트를 운영 환경으로 옮길 때 생기는 루프, 예외 처리, 라우팅, 비즈니스 로직 우회 문제를 다룹니다. 모델이 모든 orchestration을 맡는 구조 대신, 결정적 코드와 에이전트 추론을 분리하려는 설계가 핵심입니다.

Genkit으로 agentic full-stack 앱 만들기

Genkit Agents API는 대화형 AI 앱에 필요한 메시지 이력, 상태 저장, 스트리밍, tool loop, human-in-the-loop 흐름을 한 인터페이스로 묶습니다. TypeScript와 Go 기반 full-stack 앱에서 매번 반복하던 agent plumbing을 줄이려는 시도입니다.

:books: 학습 자료

MCP 입문: AI 엔지니어와 개발자가 Model Context Protocol을 배워야 하는 이유

Microsoft는 MCP를 모델이 데이터베이스, 내부 API, 문서, 배포 시스템과 연결되는 표준 인터페이스로 설명합니다. 글은 MCP for Beginners 커리큘럼을 중심으로 개념, 예제 코드, 최신 업데이트를 따라갈 수 있게 정리합니다.

C# 코드를 Microsoft Agent Framework로 이전하기

Jesse Liberty는 기존 C# 예제를 Microsoft Agent Framework로 옮기는 과정을 다룹니다. AutoGen과 Semantic Kernel 계열 흐름이 통합되는 방향을 따라가며, .NET 개발자가 multi-agent 워크플로와 enterprise agent 구조를 어떻게 잡을지 살펴볼 수 있습니다.

Agent Harness: 데이터를 안전하게 다루는 에이전트 실행 환경

Microsoft Agent Framework 글은 파일 접근, tool approval, memory 유형을 harness나 claw 안에서 어떻게 구성하는지 보여줍니다. 에이전트가 실제 데이터를 다룰 때는 도구를 붙이는 것보다 권한 승인, 데이터 경계, 메모리 정책을 함께 설계하는 것이 중요합니다.

Terraform MCP Server 설정과 활용 사례

Spacelift는 Terraform MCP server의 설치, 로컬 실행, 활용 사례, 보안 설정을 설명합니다. IaC 운영에서 MCP를 쓰면 에이전트가 인프라 상태와 Terraform 작업 흐름을 이해할 수 있지만, 권한과 실행 경계를 명확히 두는 것이 전제입니다.

eval prompt의 해부: LLM judge 프롬프트에 실제로 넣어야 할 것

Jim Bennett는 LLM judge에게 단순히 1점부터 10점까지 평가하라고 시키는 방식이 왜 불안정한지 설명합니다. 좋은 eval prompt는 평가자 역할, 품질 기준, 점수 의미, 좋은 답의 예시를 분명히 해야 하며, 그 구조가 반복 가능한 평가의 출발점입니다.

:light_bulb: 인사이트

AI 도구가 읽기에서 행동으로 넘어갈 때의 보안

Microsoft Security는 MCP tool poisoning처럼 신뢰된 도구 설명이 조작될 때 에이전트가 데이터 유출이나 무단 행동의 제어면이 될 수 있다고 경고합니다. 에이전트 보안은 프롬프트 방어만이 아니라 tool metadata, 승인 흐름, 탐지와 격리까지 포함해야 합니다.

Vibe slop은 증상이고 context debt가 질병이다

The New Stack은 AI가 만든 낮은 품질의 산출물 자체보다 더 깊은 문제를 context debt로 봅니다. API, 서비스, 업무 맥락이 복잡하게 얽혀 사람과 에이전트 모두 전체 그림을 잃으면, 생성 속도는 올라가도 유지보수 가능성은 빠르게 떨어집니다.

Agent Memory

O’Reilly는 에이전트 메모리를 단순한 긴 컨텍스트가 아니라 검색, 저장, 갱신, 추상화 수준 조절이 필요한 설계 요소로 다룹니다. 개인화와 장기 작업을 원한다면 무엇을 기억하고 언제 잊을지에 대한 정책이 모델 성능만큼 중요해집니다.

AI benchmark가 말해주지 않는 것

Microsoft for Developers는 Agent Experience 관점에서 벤치마크 점수만으로 에이전트가 실제 기술 스택에서 잘 작동한다고 볼 수 없다고 설명합니다. 문서 품질, 샘플 코드, 오류 메시지, 도구 피드백처럼 에이전트가 작업하며 만나는 환경 자체가 성능을 좌우합니다.

에이전트 설계의 진짜 병목은 사람의 결정이다

ShiftMag는 에이전트가 권한 있는 행동을 하기 전 인간 승인과 알림을 어떻게 요청하는지가 실제 병목이 된다고 봅니다. 모든 것을 자동화하려 하기보다 최소 권한, 명확한 승인 메시지, 적절한 handoff 설계가 운영 가능한 에이전트의 핵심입니다.

4 Likes