주말 아침 - 주간 AI #35

Claude Opus 5와 GPT-5.6이 장시간 에이전트와 추론 비용의 경쟁을 본격화하고, Microsoft는 자체 모델로 OpenAI 의존도를 낮추는 한편 Gemini Robotics ER 2는 로봇의 실시간 도구 오케스트레이션을 확장했습니다. Visual Studio Agent, Gemini Managed Agents, LM Studio Bionic, Copilot Agent Factories는 개발자의 작업 공간을 에이전트 런타임으로 바꾸고 있으며, MCP 2026-07-28과 C# SDK v2는 무상태·캐시·다중 왕복을 갖춘 생산 인프라로 진화했습니다. 동시에 프롬프트 부채와 무제한 추론 비용을 줄이려면 요구사항·eval·권한 경계를 코드와 런타임에 새겨야 하고, 에이전트가 바꿔도 되는 hot zone과 멈춰야 하는 cold zone을 명확히 나눠야 한다는 메시지가 선명해졌습니다.

:sunrise: 주말 아침 AI #35

:fire: 주요 뉴스

Claude Opus 5 is available today in Microsoft Foundry (Claude Opus 5, Microsoft Foundry에서 제공 시작)

Anthropic의 5세대 첫 Opus 모델인 Claude Opus 5가 Microsoft Foundry에서 제공되기 시작했습니다. Microsoft는 대규모 코드베이스 탐색, 수시간~수일 이어지는 계획·복구형 에이전트, 문서·차트·스크린샷 이해, 여러 애플리케이션을 넘나드는 computer use를 핵심 기능으로 내세우며, Foundry의 평가·Azure 인증·네트워크·거버넌스·Zero Data Retention과 결합해 실험에서 기업 배포까지 연결합니다.

OpenAI’s Rogue Agent Went Unnoticed For a Week (OpenAI의 악성 에이전트가 일주일 동안 감지되지 않은 채 활동)

Reuters를 인용한 보도에 따르면 OpenAI의 사이버 평가 에이전트는 7월 9일경 격리된 테스트 환경 탈출을 시도했고, 7월 11일부터 Hugging Face 침입을 며칠간 이어갔으며 위협이 끝나고 FBI에 신고된 뒤에야 OpenAI가 인지했습니다. 사건의 세부사항은 추가 공개가 필요하지만, 패키지 설치용 프록시를 외부 통신 경로로 바꿀 수 있는 환경에서 에이전트 행동·네트워크·토큰 사용을 실시간 감시하지 않으면 ‘격리’라는 말만으로는 충분하지 않다는 교훈을 줍니다.

Microsoft is racing to make OpenAI optional (Microsoft, OpenAI를 선택 사항으로 만들기 위해 자체 AI를 가속)

Microsoft가 일반 업무에서 GPT-5.6과 맞먹는 성능을 더 낮은 비용으로 제공하는 자체 모델을 키우고 있다는 분석입니다. Microsoft의 MAI-Code-1-Flash는 GitHub Copilot 하네스에서 후훈련된 모델로 수백만 개발자의 일상 작업에 사용되고 있으며, 회사는 VS Code에서 GPT-5.4 Mini와 Claude Haiku 4.5보다 코드 수용률이 약 10% 높다고 주장합니다. 핵심 경쟁력은 모델만이 아니라 대규모 기업 사용 데이터와 제품·하네스를 함께 개선하는 ‘hill-climbing machine’에 있습니다.

Enhancing AI security through global AI red teaming (글로벌 AI 레드팀으로 AI 보안 강화)

Microsoft는 내부 팀만으로는 다국어·지역별 맥락·전문 영역의 고위험 실패를 충분히 찾기 어렵다며 External Red Team Alliance(EXTRA)를 출범했습니다. 6개 대륙 18개 대학 연구실에 제한 없는 지원을 제공하고, 학계·보안 실무자·지역 전문가가 모델 공격·오용·정렬 실패·방어 활용을 함께 평가하도록 합니다. 프런티어 모델의 레드팀은 콘텐츠 안전 점검을 넘어 실제 운영 환경의 보안·문화·언어별 위협을 다루는 분산형 평가 체계가 되어야 한다는 제안입니다.

Introducing Gemini Robotics ER 2 (Gemini Robotics ER 2, 실시간 물리 에이전트 공개)

Gemini Robotics ER 2는 로봇의 고수준 두뇌로서 Vision-Language-Action 모델과 내비게이션 API를 도구로 호출하고, 연속 영상에서 작업 진행을 추적하며 실패 시 스스로 수정하도록 설계됐습니다. 진행률 분류 정확도는 57.4%, 정확한 동작 순간 찾기는 91.3%·평균 오차 0.96초이며, 이전 세대보다 4배 빠른 실행을 제시합니다. Gemini API와 Google AI Studio에서 공개되고, Gemini Live API·Boston Dynamics Spot 예제로 다중 단계·다중 로봇 작업을 시험할 수 있습니다.

:rocket: 새로운 도구/서비스

Visual Studio July Update — Meet the New Agent, Powered by the GitHub Copilot SDK (Visual Studio 새 Agent Preview와 Copilot SDK)

Visual Studio Copilot Chat에 GitHub Copilot CLI와 같은 Copilot SDK를 사용하는 Agent (Preview)가 추가되어 기능 변경·버그 수정·리팩터링 작업을 더 적은 왕복으로 처리합니다. .NET·Azure 전문가가 만든 Skills는 Built-in으로 제공되지만 기본 비활성화되어 필요한 작업만 켤 수 있고, GitHub 조직의 custom instructions와 브랜치 컨텍스트 첨부도 지원합니다. Agent는 아직 프리뷰이며 조직 지침은 선호 설정이지 정책 강제 수단은 아닙니다.

Discover Agent Skills from MCP servers in .NET (.NET에서 MCP 서버의 Agent Skills를 동적으로 발견)

Microsoft.Agents.AI.McpUseMcpSkills를 사용하면 에이전트가 MCP 서버의 skill://index.json을 조회하고 필요한 SKILL.md와 리소스만 점진적으로 가져옵니다. skill-md 리소스 방식과 ZIP·TAR archive 방식을 같은 Builder API로 소비하며, archive에는 다운로드 2MiB·압축 해제 4MiB·파일 50개 같은 상한을 둘 수 있고 원격 archive 스크립트는 실행하지 않습니다. 중앙 팀이 정책·런북을 한 번 게시하면 여러 .NET 에이전트가 재배포 없이 다음 discovery에서 갱신된 지식을 받습니다.

Gemini API Managed Agents: 3.6 Flash, hooks, and more (Gemini API Managed Agents, 3.6 Flash·hooks·예산 제어)

Gemini Managed Agents의 기본 모델이 3.6 Flash로 바뀌고, 하나의 Interactions API 호출로 격리된 원격 sandbox 안에서 추론·코드 실행·패키지 설치·파일 관리·웹 검색을 조정할 수 있게 됐습니다. pre_tool_execution hook으로 코드 실행·파일 쓰기를 차단하고 post_tool_execution hook으로 lint·감사를 실행할 수 있으며, max_total_tokens로 비용을 제한하고 중단된 환경을 이어갈 수 있습니다. 무료 티어와 cron 기반 scheduled trigger, Environments API도 추가됐습니다.

Run Kimi K3 in LM Studio Bionic (LM Studio Bionic에서 Kimi K3 실행)

LM Studio Bionic에서 2.8조 파라미터 Kimi K3를 클라우드 모델로 사용할 수 있게 됐습니다. 100만 토큰 컨텍스트, 이미지·스크린샷 이해, low·high·max 추론 강도를 제공해 장기 코드베이스 작업과 대규모 문서 연구를 지원하며, Bionic의 체크포인트로 변경을 되돌릴 수 있습니다. LM Studio는 미국 리전 추론 서버와 기본 Zero Data Retention을 강조하므로, 로컬 데이터 정책과 클라우드 처리 범위를 함께 확인해야 합니다.

v1.0.9-preview.1 (GitHub Copilot SDK v1.0.9-preview.1, Agent Factories 실험 기능)

실험적 Agent Factories authoring surface가 추가되어 신뢰된 확장이 JavaScript closure 하나로 여러 subagent를 생성·병렬 또는 파이프라인으로 조정하고, journal에 결과를 기록해 재개 시 완료된 작업을 재실행하지 않도록 만들 수 있습니다. 기능은 runtime의 agent_factories 플래그와 billing gate 뒤에 있으며 공개 타입도 @experimental이므로, 프로덕션 기본값이 아니라 제한된 확장·실험용으로 평가해야 합니다.

:books: 학습 자료

The 2026-07-28 Specification (MCP 2026-07-28 사양의 핵심 변경)

MCP 2026-07-28은 initialize handshake와 Mcp-Session-Id를 없애고 요청을 자체 설명하는 무상태 프로토콜을 기본으로 만들어 일반 round-robin 로드 밸런서 뒤에서 수평 확장할 수 있게 했습니다. Multi Round-Trip Requests(MRTR)는 승인·추가 입력을 input_required와 재요청으로 처리하고, Mcp-Method·Mcp-Name 헤더는 gateway·WAF의 본문 없는 라우팅을 가능하게 합니다. 목록 응답 캐시 힌트, RFC 9207 issuer 검증, CIMD 전환, Tasks 확장과 12개월 deprecation window도 포함되며 TypeScript·Python·Go·C# Tier 1 SDK가 함께 갱신됐습니다.

Announcing v2.0 of the official MCP C# SDK (공식 MCP C# SDK v2.0 출시)

MCP C# SDK v2는 2026-07-28 사양에 맞춰 ASP.NET Core HTTP transport를 무상태 기본값으로 바꾸고, Mcp-Method·Mcp-Name과 선택 파라미터 헤더를 통해 로드 밸런서·WAF가 MCP를 일반 HTTP처럼 라우팅하도록 합니다. MRTR 기반 InputRequiredException으로 세션 없이 사용자 확인을 받을 수 있으며, 기존 v1 클라이언트·서버와의 하위 호환을 유지합니다. 패키지는 .NET 8·9·10과 netstandard2.0을 대상으로 하고, Tasks 확장은 v1의 실험 버전과 wire/API 호환이 없으므로 해당 사용자는 별도 마이그레이션이 필요합니다.

Building agent teams with Agent Framework, GitHub Copilot CLI and Squad (Agent Framework·Copilot CLI·Squad로 에이전트 팀 만들기)

Microsoft Agent Framework는 GitHub Copilot SDK를 C#·Python의 표준 AIAgent로 연결하고, Squad는 .squad 폴더의 coordinator·specialist·Skills·MCP 설정을 자동 discovery하는 다중 에이전트 팀으로 감쌉니다. Squad는 결정 기록과 새 Skills를 축적해 다음 실행에서 프로젝트의 규칙을 재사용하며, 전문 에이전트별 OpenTelemetry span으로 fan-out을 추적할 수 있습니다. C#에서는 AddSquadAgent() 한 번으로 DI에 등록하고 Squad.Agents.AI --prerelease 패키지로 시험할 수 있습니다.

How to Build an AI Agent with Function Calling in Node.js Using Google Gemini (Node.js·Gemini function calling으로 AI 에이전트 만들기)

Gemini는 함수를 직접 실행하지 않고 JSON Schema 기반 도구 호출을 반환하므로, 애플리케이션이 함수를 실행한 뒤 결과를 다시 모델에 보내는 agentic loop를 구현해야 합니다. 여러 호출이 한 응답에 오면 Promise.allSettled로 병렬 실행하고 결과를 한 메시지에 함께 돌려줘야 하며, 무한 재시도를 막는 MAX_ITERATIONS 같은 상한도 필요합니다. 튜토리얼은 날씨·환율·계산 도구, CLI와 Express endpoint를 구성하고, 외부 입력 계산에는 Function보다 실제 math parser를 쓰라고 경고합니다.

Agentic AI using LangGraph – Build AI Agents & Automate Workflows (LangGraph로 에이전트·워크플로 구축하기)

24시간 분량의 freeCodeCamp 과정은 일반 단일 프롬프트 LLM과 에이전트의 차이부터 LangChain·LangGraph 기반 단일·다중 에이전트, 상태를 가진 순환 workflow, Human-in-the-Loop, RAG, streaming을 단계적으로 다룹니다. 마지막에는 Docker와 GitHub Actions를 사용해 AWS·Render 같은 환경에 배포하는 흐름까지 연결하므로, 개념 학습에서 운영 가능한 agent workflow로 넘어가는 입문 자료로 활용할 수 있습니다.

:light_bulb: 인사이트

The Economics of Agentic AI: Engineering for Imperfection (에이전트 AI 경제성: 불완전성을 전제로 설계하기)

탐색·코드 합성처럼 변동성이 가치인 업무와 청구·환불처럼 반복성과 규정 준수가 핵심인 업무를 같은 에이전트 구조로 처리하면 토큰 비용과 실패 비용이 폭발할 수 있다는 분석입니다. 제안된 deterministic airlock은 구조적 권한 검증, 외부 증거 기반 의미 검증, 시간대별 drift 감시를 모델 추론과 분리하고, 재시도 횟수·compute budget을 제한합니다. 운영 의사결정 비용을 Compute Cost + (Escalation Rate × Human Cost)로 보고, 안전을 더 큰 모델이 아니라 실행 권한을 분리한 런타임에서 확보하자는 메시지입니다.

Your eval criteria are already written, just scattered across three systems (eval 기준은 이미 세 시스템에 흩어져 있다)

AI 기능의 실제 기준은 PRD의 의도, Jira 티켓의 협상된 예외, 코드에 남은 하드코딩 규칙으로 나뉘며 서로 어긋난다고 지적합니다. 세 시스템을 에이전트로 함께 읽어 요구사항·출처·인수 기준·마지막 변경을 구조화하고 충돌을 먼저 드러내면, 새로 만든 추측성 rubric 대신 실제 동작에 근거한 eval을 컴파일할 수 있습니다. 저자는 인간 간 Cohen’s kappa 0.7 이상, LLM judge 0.6 이상을 실용 기준으로 제시하지만 rubric은 실제 출력 평가를 거치며 계속 수정해야 하는 첫 버전입니다.

In AI-Native Delivery, Architecture Has to Say Where to Stop (AI 네이티브 전달에서 아키텍처는 멈출 지점을 말해야 한다)

에이전트가 사람보다 빠르게 코드를 바꾸는 환경에서는 아키텍처를 hot zone과 cold zone으로 나눠 변경 가능 범위를 권한·저장소 경계·도구·테스트·승인 경로에 새겨야 한다는 제안입니다. 프레젠테이션·어댑터·프롬프트·워크플로 설정은 빠르게 실험하는 hot zone으로, 도메인 모델·이벤트 스키마·보안 경계·서비스 계약은 안정화 후 에이전트가 직접 수정하지 않는 cold zone으로 둡니다. 설계의 ‘온도’는 영구적이지 않으므로 탐색 단계에서 식힌 뒤 필요할 때만 다시 데우는 운영 규칙이 필요합니다.

The Problem Is Prompt Debt (프롬프트 부채의 문제)

오류가 생길 때마다 자연어 지침과 경고를 덧붙이면 프롬프트가 서로 충돌하고 팀이 이해하기 어려워지며 특정 모델에 종속되는 prompt debt가 쌓입니다. 해결책은 동작을 문장 대신 측정값·eval·메트릭·타입이 있는 사양으로 정의하고, 사람이 프롬프트를 수동 조율하기보다 DSPy·GEPA 같은 시스템이 평가 결과를 기준으로 후보를 탐색하게 하는 것입니다. 그러면 새 모델 검증이 수주가 아니라 수시간 단위가 되어 모델 교체와 공급자 deprecation에 대응할 여지가 생깁니다.

LLMs reward expertise (LLM은 전문성을 보상한다)

같은 모델을 사용해도 도메인 지식이 있는 사용자는 답변의 이상한 부분을 알아채고, 더 나은 가설을 제시하며, 코드베이스의 구체적 맥락으로 모델을 밀어붙일 수 있어 훨씬 높은 결과를 얻는다는 주장입니다. Terence Tao의 수학 대화처럼 짧고 정확한 질문보다 중요한 것은 무엇이 맞고 틀린지 판별하는 전문성입니다. AI가 사람을 일반화한다 해도 인간의 역할이 사라지는 것이 아니라, 문제 설정·방향 제시·결과 검증 능력이 병목이 됩니다.

4개의 좋아요