주말 아침 - 주간 AI #41

ChatGPT Images 2.5와 MAI-Image-2.6이 이미지 생성의 속도와 편집 정밀도를 끌어올리고, Gemini는 Windows 데스크톱으로, AI 에이전트는 Kotlin·Cursor·Copilot의 실제 개발 환경으로 들어왔습니다. 이번 주의 더 중요한 변화는 기능의 수보다 에이전트를 어떻게 평가하고, 어떤 권한으로 실행하며, 비용과 최종 판단을 누가 책임질 것인가에 있습니다. 새 모델과 도구부터 행동 평가, 최소 권한, ROI, 인간이 소유해야 할 바깥 고리까지 함께 살펴봅니다.

:sunrise: 주말 아침 AI #41

:fire: 주요 뉴스

ChatGPT Images 2.5, 정밀 편집과 생성 속도를 함께 개선

OpenAI는 ChatGPT Images 2.5의 세부 묘사, 참조 이미지 보존, 다중 턴 편집 일관성을 개선하고 Images 2.0 대비 생성 지연을 최대 50% 줄였다고 발표했습니다. ChatGPT·ChatGPT Work·Codex 전 등급에 배포하며 API에는 GPT-Image-2.5 Flare와 Sunburst를 제공합니다. 성능 수치는 회사 측 설명이며 안전 식별에는 C2PA 메타데이터와 보이지 않는 워터마크를 계속 사용합니다.

MAI-Image-2.6, 정밀형과 고속형으로 이미지 생성 제품화

Microsoft는 MAI-Image-2.6과 지연에 민감한 대량 작업용 Flash 변형을 Microsoft Foundry 공개 미리 보기와 MAI Playground에 내놓았습니다. 두 모델은 다중 참조 이미지 편집, 웹 그라운딩, 동적 화면비와 최대 1.5K 해상도를 지원합니다. Arena 순위와 GPT-Image-2-Medium 대비 속도·효율 수치는 2026년 9월 4일 기준 회사 발표치입니다.

A2A 프로토콜, Agentic AI Foundation 성장 단계 프로젝트로 편입

Agent2Agent 프로토콜은 Agentic AI Foundation의 성장 단계 프로젝트로 받아들여졌습니다. MCP가 에이전트와 도구·데이터를 잇는 수직 통합이라면 A2A는 서로 다른 프레임워크의 에이전트가 발견·협상·작업 위임을 수행하는 수평 계층을 지향합니다. 글은 150개가 넘는 조직의 지원과 주요 클라우드·프레임워크 채택을 밝히며 중립 거버넌스를 강조합니다.

Gemini 앱, Windows 10·11용 데스크톱 버전 출시

Google은 Windows 10·11에서 사용할 수 있는 Gemini 데스크톱 앱을 전 세계에 출시했습니다. Alt+Space로 현재 작업 위에 호출하고, 전용 공간에서 Google 앱 정보를 활용하거나 Gemini Spark에 다단계 작업을 맡길 수 있으며 이미지·영상 생성도 지원합니다. 일부 기능은 Google AI 구독과 18세 이상 조건이 필요하고 가용성은 지역에 따라 달라집니다.

Codex와 ChatGPT로 항균 후보 탐색을 돕는 연구 현장

OpenAI는 César de la Fuente 연구실이 자체 딥러닝 모델로 생물학적 서열에서 항균 후보를 찾고 ChatGPT와 Codex를 가설 구상, 코드 작성, 데이터 처리와 결과 분석에 활용하는 사례를 소개했습니다. 초기 후보 탐색을 수년에서 수시간으로 줄일 수 있다고 설명하지만, 후보가 치료제가 되려면 독성·내성·체내 이동·제조·규제·임상시험을 거쳐야 합니다. 이는 연구 활용 사례이지 승인된 신약 발표가 아닙니다.

:rocket: 새로운 도구/서비스

GitHub HydraFusion, 여러 모델을 작업별로 조합하는 연구 미리 보기

HydraFusion은 요청마다 단일 모델, 초안 뒤 품질 게이트를 거치는 단계적 상향, 다른 모델 계열의 읽기 전용 비평 후 수정 중 하나를 선택합니다. GitHub Copilot CLI의 /experimental 경로로 모든 Copilot 요금제에 연구 미리 보기로 제공되며 사용한 모델의 표준 토큰 요금이 적용됩니다. TerminalBench 2.1의 4.9%포인트 향상과 67% 비용 절감은 통제된 오프라인 평가의 회사 측 결과이고 제품 동작은 바뀔 수 있습니다.

ADK for Kotlin 1.0, 서버와 Android 에이전트 개발 정식 지원

Google은 ADK for Kotlin 1.0을 정식 출시했습니다. ADK 1.0 Core와 기능을 맞추고 계층형 다중 에이전트, 문맥 압축, 사람 확인, 세션 재개, Java 상호운용을 제공하며 Android에는 LiteRT-LM·ML Kit·Firebase·Room·AppSearch 확장을 둡니다. KSP가 도구 스키마를 컴파일 시점에 만들어 런타임 리플렉션을 쓰지 않으며 예제의 금융 규정 준수는 보장하지 않는다고 명시합니다.

Cursor Projects, 장기 작업을 조율하는 에이전트 코디네이터 공개

Cursor Projects는 기능 개발·마이그레이션·지속 관리처럼 긴 작업의 문맥을 유지하고 코디네이터가 클라우드와 로컬 하위 에이전트에 일을 위임하는 베타 기능입니다. 공유 문맥과 Slack·PR·일정 구독을 통해 새 신호에 반응하며 모든 사용자에게 단계적으로 배포됩니다. PR 증가 수치는 Cursor 내부 사용 관찰이므로 일반적인 생산성 보장으로 해석할 수 없습니다.

Azure AI Speech LLM 2607, 다국어 전사와 용어 목록 개선

LLM Speech 2607은 혼합 언어, Tier 2·3 언어, 이름·브랜드·전문 용어 인식을 개선하고 2,000개가 넘는 항목의 전용 phraseList 입력을 지원합니다. Microsoft 내부 평가에서는 2605보다 지연이 최대 3배 개선됐다고 밝혔습니다. Fast API와 Real-Time API에 서비스 측으로 자동 배포되므로 고객의 애플리케이션 구조 변경은 필요하지 않으며 수치는 독립 검증 결과가 아닙니다.

OpenClaw 2026.9.4, 대화 기반 스킬 생성과 배포 검증 확대

OpenClaw 2026.9.4는 플러그인·스킬 탐색을 개선하고 과거 대화를 조정 가능한 채팅을 통해 재사용 스킬로 만드는 기능, GPT Image 2.5 지원, 클라우드 세션 제어와 터미널 대화형 질문을 추가했습니다. 서명된 소스와 npm·Docker·macOS·Linux 산출물에 대한 검증 증거를 공개했습니다. 다만 일부 원 게시자 읽기, ClawHub 복구, Android 자격 확인 등 남은 항목도 명시돼 있어 모든 배포 축이 완료된 릴리스로 과장하지 않습니다.

:books: 학습 자료

AI 코딩 에이전트는 최종 점수보다 행동 단위로 검증하라

글은 대형 종단 벤치마크만으로는 회귀 원인을 알기 어렵다며 질문하기, 로컬 검증기 실행하기, 권위 링크 제시하기 같은 관찰 가능한 행동을 별도 평가하자고 제안합니다. 빠른 결정론적 검사와 복잡한 결과 기반 판정을 나누고 비결정성을 고려해 배치 추세를 보라고 설명합니다. 행동 평가는 종단 평가를 대체하지 않고 원인 진단과 안전한 반복을 보완합니다.

Agent Skills 입문, 작은 기능 패키지부터 보안·감사까지

Jesse Liberty는 스킬을 메타데이터·프롬프트·선택적 코드·예제를 묶은 작은 기능 패키지로 설명하고 발견, 점진 공개, 실행, 감사 흐름을 C# 예제와 함께 소개합니다. 최소 권한, 런타임 격리, 비밀을 가린 감사 로그, 승인된 레지스트리와 CI 테스트를 운영 기준으로 제시합니다. 본문의 생성 코드가 완전히 시험되지 않았다는 저자 경고가 있으므로 개념·출발점으로 활용해야 합니다.

Firebase AI Logic로 Gemini 음성을 앱에 넣는 다섯 가지 방법

Firebase AI Logic를 통해 모바일·웹 앱이 Gemini TTS로 텍스트에서 직접 자연스러운 음성을 만들 수 있습니다. 글은 언어 학습, 손을 쓰지 않는 안내, 접근성, 이야기 낭독, 다중 화자 팟캐스트의 다섯 사례를 설명합니다. 일부 앱의 지연·서버 비용 개선은 개별 개발자의 사례 진술이며 모든 앱의 비용 절감 보장은 아닙니다.

GitHub Copilot Spaces로 반복 설명 없는 프로젝트 문맥 만들기

Copilot Spaces는 저장소·파일·이슈·PR·지침·대화 같은 배경 자료를 한 공간에 모아 이후 질문에 재사용하는 방법을 제공합니다. 글은 공간을 만들고 지침과 출처를 추가하는 절차, 조직 소유 공간의 권한, main 브랜치 최신 내용 반영과 모델 선택을 설명합니다. 큰 저장소를 모두 넣기보다 관련 파일을 ■게 선택해야 하며 질문은 일반 Copilot Chat 요청과 AI 크레딧을 소비합니다.

OpenCode와 로컬 모델로 오픈소스 코딩 도우미 구성하기

Red Hat 글은 OpenCode를 터미널·데스크톱·IDE 확장으로 쓰고 로컬 LLM을 연결하는 절차를 설명합니다. AMD·NVIDIA 환경에는 Ollama, Intel 내장 GPU에는 OpenVINO Model Server 예시를 제시하고 Qwen3 계열을 OpenCode의 OpenAI 호환 공급자로 설정합니다. OpenCode는 모델 자체가 아니며 하드웨어와 선택한 모델에 따라 성능·기능이 달라집니다.

:light_bulb: 인사이트

AI 에이전트에도 독립 신원과 최소 권한이 필요하다

Ross Kukulinski 인터뷰를 바탕으로 IP나 같은 네트워크에 있다는 사실보다 사람·장치·워크로드의 신원을 기준으로 접근을 결정해야 한다고 주장합니다. 에이전트마다 변경·폐기 가능한 신원과 정책을 주고 필요한 노드·서비스·데이터만 연결하면 넓은 네트워크 신뢰를 줄일 수 있습니다. 이는 Tailscale 관점의 아키텍처 제안이며 특정 구현의 완전한 침해 방지를 입증한 평가는 아닙니다.

AI 에이전트 비용은 사용량 관찰·한도·성과 증거로 관리하라

Microsoft는 에이전트 비용 거버넌스를 사용량을 보고, 실행 중 한도를 걸고, 사업 성과를 증명하는 순환으로 설명합니다. Foundry 추적은 도구 호출·재시도·지연·토큰과 추정 비용을 보여주고 프로젝트 태그와 AI Gateway 지표는 비용 귀속을 돕습니다. Foundry 수치는 운영 판단용 추정치이며 최종 재무 대조의 권위는 Microsoft Cost Management와 청구서에 있고 일부 프로젝트 비용 기능은 미리 보기입니다.

같은 LLM도 도메인 전문성이 있어야 더 깊게 활용할 수 있다

Sean Goedecke는 좋은 LLM 활용의 핵심이 요령 많은 프롬프트보다 해당 도메인을 이해하고 이상한 답을 알아보며 대안을 제시하는 능력이라고 주장합니다. Terence Tao의 수학 대화와 자신의 코드베이스 경험을 예로 들어 전문가는 짧게 묻고 강하게 방향을 교정할 수 있다고 설명합니다. O’Reilly가 저자 허가로 재게시한 관점 글이며 통제 실험의 보편적 결론은 아닙니다.

AI 개발 생산성은 코드량이나 PR 수가 아닌 사업 가치로 측정하라

James Shore는 토큰 비용과 도입·교육·유지보수 부담을 포함하지 않은 체감 생산성만으로 AI 투자 수익을 판단하기 어렵다고 지적합니다. 코드 줄 수와 PR 수는 작업 가치를 나타내지 않고 목표가 되면 왜곡되므로 사람을 평가하지 말고 특정 AI 활용 방식을 한시적으로 비교·학습하라고 권합니다. 제시된 기업 비용·생산성 수치는 익명 사례이고 글은 후속 측정 시리즈의 문제 제기 편입니다.

에이전트가 실행해도 최종 판단과 설명 책임은 사람이 가져야 한다

Addy Osmani는 모델과 하네스가 조사·구현·검증의 내부 루프를 돌더라도 생산 반영 여부를 결정하는 바깥 루프는 사람이 소유해야 한다고 주장합니다. 품질 신호가 근거를 만들고 사람이 출시·차단·범위 축소를 판정하며 나중에 이유를 설명할 수 있어야 한다는 구조입니다. O’Reilly가 저자의 허가로 재게시한 관점 글이며 인용한 업계 조사와 실험은 글 자체의 독립 재현이 아닙니다.

5개의 좋아요