분석 기간: 2026-07-22 ~ 2026-07-28 · 독자용 상세 리포트
[AIW] 7/28 이번 변화의 중심은 모델 뉴스보다 에이전트 운영 계약이다
요구사항 우선 렌즈
최신 사용자 요구사항을 우선 적용했습니다: Python/LLM 서비스 개발자가 1~4주 안에 실험할 수 있는 SDK/runtime/eval/RAG/tooling · MCP/tool calling/workflow automation/agent framework 변화 · RAG/vector DB/inference/runtime/observability/deployment 변화 · 주요 provider 모델/API/pricing/rate limit/SDK/platform 변경
오늘의 핫 뉴스
2026-07-28 기준 새로 눈에 띈 항목을 먼저 배치했습니다. 이후 섹션은 배경, 출처, 실행 항목 순서로 이어집니다.
#1 · Tool · hnrss-frontpage · 2026-07-28
MCP 2026-07-28 Specification: transport going stateless
무슨 뉴스인가: MCP 2026-07-28 specification은 initialize/initialized exchange와 Mcp-Session-Id header를 제거하고 각 request가 독립적으로 이동하는 stateless transport로 바꿨다. 또한 Streamable HTTP 요청에 Mcp-Method와 Mcp-Name 헤더를 요구하고, tools/list·prompts/list·resources/list·resources/read 응답에는 ttlMs와 cacheScope를 추가했다.
왜 지금 보나: MCP 서버나 게이트웨이를 운영한다면 JSON body를 파싱하지 않고 헤더로 라우팅·과금·WAF 정책을 잡을 수 있다. 반대로 session 기반 상태와 Dynamic Client Registration 의존은 정리해야 하며 TypeScript, Python, Go, C# SDK 업데이트도 바로 확인해야 한다.
원문 보기원문 링크: https://blog.modelcontextprotocol.io/posts/2026-07-28
#2 · Tool · hnrss-ai · 2026-07-28
Google's Beyond Zero: Enterprise Security for the AI Era
무슨 뉴스인가: Google의 Beyond Zero 글은 자율 AI agent와 기업 데이터 접근 속도가 기존 application-centric zero trust 모델을 압박한다고 주장한다. 제안은 권한 경계를 애플리케이션이 아니라 개별 resource/action으로 줄이고, MCP나 API 같은 접근 경로에서도 per-resource access decision을 빠르게 수행하자는 구조다.
왜 지금 보나: agent가 사용자 대신 여러 도구를 호출하는 서비스에서는 로그인 성공보다 각 action의 의도, 직전·직후 활동, resource 민감도를 함께 평가해야 한다. User Intent와 Agent Intent를 prompt injection 방어 입력으로 쓰는 표는 agent 권한 설계 체크리스트로 바로 바꿀 수 있다.
원문 보기원문 링크: https://spawn-queue.acm.org/doi/10.1145/3819083
#3 · Community · hnrss-ai · 2026-07-28
Fast Remediation Is the New Trust Model (JFrog and OpenAI Zero-Day Findings)
무슨 뉴스인가: JFrog 글은 OpenAI 보안·레드팀과 협업해 zero-day 취약점을 찾고 CVE 공개와 연구자 credit까지 이어지는 대응 모델을 설명한다. 본문은 cloud 고객은 이미 보호되고 self-hosted 고객은 Artifactory 7.161 등 fixed version으로 업그레이드 안내를 받았다고 적었다.
왜 지금 보나: AI 모델이 취약점 탐지에 참여하는 흐름보다 더 중요한 신호는 빠른 remediation이 신뢰 모델이 됐다는 점이다. LLM 서비스 운영자는 dependency advisory, self-hosted patch SLA, cloud 자동 보호 여부를 같은 보고 체계에 넣어야 한다.
원문 보기원문 링크: https://jfrog.com/blog/jfrog-and-openai-collaboration-on-zero-day-security-findings
핵심 메시지
이번 변화의 중심은 모델 뉴스보다 에이전트 운영 계약이다
2026-07-28 묶음에서 가장 실무적인 변화는 MCP 2026-07-28 specification과 Google Beyond Zero처럼 에이전트가 도구와 데이터에 접근하는 계약을 더 명시적으로 바꾸는 흐름이다. MCP는 session handshake를 없애고 Mcp-Method/Mcp-Name, ttlMs/cacheScope, OAuth/CIMD 마이그레이션을 제시했고, Beyond Zero는 per-resource access decision과 User Intent/Agent Intent 평가를 권한 경계로 끌어올렸다. NVIDIA와 Snowflake는 GPU 시뮬레이션, Feature Store, edge deployment를 agent workflow에 붙이는 사례를 냈고, arXiv 연구들은 RAG와 fine-tuning 평가가 도메인별 실패를 따로 재야 함을 보여준다.
반복 관찰된 흐름
에이전트 평가/운영 품질 반복 신호
반복되는 패턴은 에이전트 평가와 운영 품질을 공개 benchmark 숫자보다 내부 fixture와 실패 taxonomy로 바꾸려는 흐름이다. LangChain의 deep agents benchmark, HumanLayer의 SlopCodeBench 관찰, Claude-thermos의 cache 비용 문제, Kimi K3와 NRC RAG 연구는 모두 tool 사용, 장기 작업, 비용, chunking, fine-tuning 효과를 실제 workflow 기준으로 다시 재야 한다는 압력을 만든다.
지난 발송 대비: 새로운 독립 변화는 MCP specification처럼 프로토콜 계약이 실제로 바뀐 항목과 Snowflake/Cortex Code처럼 agent output을 production feature artifact로 옮기는 사례다. 반면 Pelicanmaxxing, SlopCodeBench, MLIR 설명 글은 새 API 발표라기보다 계속되는 평가·런타임 해석 신호이므로 단독 결론보다 보조 판단으로 읽어야 한다.
장기 흐름: 이번 메일의 주요 항목은 주간/월간 누적 트렌드 메모에도 반영되어, 반복·강화·비판 신호를 다음 리포트에서 이어서 볼 수 있습니다.
읽는 법: 다음 실험 하나를 고를 때 모델 교체부터 하지 말고 tool schema, cache TTL, permission boundary, RAG chunking, rollback 기준 중 빠진 항목 하나를 golden trace에 추가한다.
묶어서 볼 출처
- Are AI Labs Pelicanmaxxing? · hnrss-frontpage
- Benchmarking Opus 5 on SlopCodeBench · hnrss-frontpage
- Show HN: FeyNoBg – Automatic background removal model and training library · hnrss-frontpage
- Show HN: Claude-thermos keeps your Claude session warm for you · hnrss-ai
- Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensi...
- A tour of MLIR: The Dialect Stack Everyone Depends On · lobsters-ai
반복 항목은 개별 카드로 재노출하지 않고, 변화가 있는지와 어떤 체크리스트로 바꿀지만 압축했습니다.
30초 요약
이번 메일은 MCP 2026-07-28 Specification: transport going stateless, Google's Beyond Zero: Enterprise Security for the AI Era를 중심으로 최신 수집 신호를 읽습니다.
근거 출처는 geeknews, hnrss-ai, hnrss-frontpage 등이며, 각 항목은 적용 조건과 확인할 리스크를 분리해 봅니다.
출처 범위: 기업/공식 발표 · 오픈소스/개발자 도구 · 커뮤니티 반응
핫 오픈소스/도구 레이더
미리 알아두면 좋은 LLM 개발 도구, 런타임, SDK, 구현 방법론을 따로 골랐습니다.
오픈소스/도구 · geeknews · 2026-07-27
Kimi K3 weight 공개
왜 핫한가: Moonshot AI의 Kimi K3 페이지는 Kimi K3를 open-weight, native multimodal agentic model로 소개하고 Tech Blog, Full Report, Hugging Face, ModelScope 링크를 함께 제공한다. 본문은 native MXFP4 quantization을 SFT 단계부터 적용했고 MXFP8 activation으로 넓은 하드웨어 호환성을 노렸다고 설명한다.
먼저 볼 것: Kimi K3 weight 공개에서는 tool schema, 권한 경계, timeout/retry, 실패 로그를 먼저 확인하세요. 성공 데모보다 실패했을 때 어디서 멈추고 어떻게 복구하는지가 운영 품질을 가릅니다.
신호: Moonshot AI의 Kimi K3 페이지는 Kimi K3를 open-weight, native multimodal agentic model로 소개하고 Tech Blog, Full Report, Hugging Face, ModelScope 링크를 함께 제공한다. 본문은 native MXFP4 quantization을 SFT 단계부터 적용했고 MXFP8 activation으로 넓은 하드웨어 호환성을 노렸다고 설명한다.
원문 보기원문 링크: https://huggingface.co/moonshotai/Kimi-K3
출처별 핵심 소식
요약: 공식 발표, 오픈소스/도구, 커뮤니티 신호를 분리해 읽도록 압축했습니다.
읽는 법: 메일 상단의 핫 뉴스와 도구 레이더를 먼저 보고, 첨부 상세 리포트에서 원문 근거와 한계를 확인하세요.
다음 행동
- MCP client/server에서 initialize handshake, Mcp-Session-Id, DCR 의존을 검색하고 Python SDK 마이그레이션 테스트를 만든다.
- agent tool gateway에는 resource/action 단위 authorization, user intent와 agent intent 로그, prompt를 확인한다.
더 자세한 근거와 전체 기사 목록은 첨부된 상세 리포트에서 확인할 수 있습니다.
새로 잡힌 watch 후보
장기 지식으로 확정하기엔 이르지만, 최근성 때문에 확인할 만한 신규 수집 신호입니다.
승격 후보 · nvidia-developer-blog · 2026-07-28
Developing Healthcare Robotics with GPU-Native Medical Physics Simulation
이 글 요약: NVIDIA는 Isaac for Healthcare의 Endoluminal Simulation Module을 일반 제공으로 공개했고, 긴 유연 수술 기구가 내강을 통과하는 절차를 실시간으로 시뮬레이션한다고 설명했다. 또한 NVIDIA Warp, Newton Physics, CUDA, Cosmos-H를 묶어 device-anatomy 모델링, 합성 데이터, 행동 조건부 비디오 예측을 같은 파이프라인에서 다룬다.
왜 볼 만한가: Endoluminal 모듈의 일반 제공 범위, standalone package 통합 방식, i4h-tutorials 실행 조건을 확인한다.
원문 보기원문 링크: https://developer.nvidia.com/blog/developing-healthcare-robotics-with-gpu-native-medical-physics-simulation
승격 후보 · youtube-snowflake-developers-official · 2026-07-28
Productionize Features Agentic ML in Snowflake #Featurestore
이 글 요약: Snowflake Developers 영상은 Cortex Code가 고객 이탈 프로토타입 분석 결과를 Snowflake Feature Store의 재사용 가능한 feature view로 옮기는 데모를 담았다. 설명과 transcript 모두 training datasets 생성, online feature serving, 자연어 prompt 기반 feature importance와 recommendation 자동화를 연결한다.
왜 볼 만한가: Cortex Code가 생성한 feature view 코드, Feature Store 권한, online serving 지연 시간과 rollback 경로를 확인한다.
주의: 스폰서/프로모션성 문구가 섞여 있어 신호 강도를 낮게 봐야 합니다.
원문 보기원문 링크: https://www.youtube.com/watch?v=A8otkoeDTH0
승격 후보 · youtube-oracle-developers-official · 2026-07-28
The Types of AI Agent Memory (Memory Engineering)
이 글 요약: Oracle Developers 영상 설명은 agent memory를 working memory, episodic memory, semantic memory, procedural memory, shared memory로 나눠 설명한다. 수집 메타데이터에는 ko 자동 자막이 선택됐지만 empty_transcript였고, 조회수 48과 Oracle AI developer hub 링크만 함께 남아 있다.
왜 볼 만한가: 현재 agent 상태 저장소가 working, episodic, semantic, procedural, shared 중 어디까지 분리돼 있는지 점검한다.
원문 보기원문 링크: https://www.youtube.com/shorts/3r1ezZ4rS_A
승격 후보 · nvidia-blog · 2026-07-28
Powerful Compute So Compact, It’s Clutch — Build AI Anywhere With NVIDIA Jetson
이 글 요약: NVIDIA는 Jetson 플랫폼을 edge AI와 robotics용 agentic-ready AI 플랫폼으로 소개하며 Jetson Orin Nano Super, Jetson AGX Orin, Jetson AGX Thor 활용 사례를 묶었다. 본문 후반에는 Jetson Device Skills와 Jetson BSP Skills GitHub 저장소가 coding AI agents로 edge AI를 생성·최적화·배포하는 보조 수단으로 제시된다.
왜 볼 만한가: Jetson Device Skills와 BSP Skills가 실제 코드/명령/권한 경계를 포함하는지, 아니면 소개용 예제인지 확인한다.
주의: 스폰서/프로모션성 문구가 섞여 있어 신호 강도를 낮게 봐야 합니다.
원문 보기원문 링크: https://blogs.nvidia.com/blog/build-ai-with-nvidia-jetson
소개 · arxiv-cs-cl · 2026-07-28
INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capabili...
이 글 요약: INS-ActBench 논문은 기존 benchmark가 domain knowledge, numerical reasoning, long-context, tool use를 분리 평가해 실제 전문 workflow를 충분히 재지 못한다고 본다. 새 benchmark는 16개 actuarial associations의 공개 시험과 sample questions에서 12,050 Q&A pairs를 만들고 knowledge, long-context case reasoning, spreadsheet/R-code practice 세 subset으로 나눴다.
왜 볼 만한가: 내부 eval에 long-context case, tool-executable numerical output, jurisdiction/context-sensitive failure를 별도 축으로 둘지 검토한다.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기원문 링크: https://arxiv.org/abs/2607.24273
한눈에 보는 판세
한눈에 보는 판세
2026-07-28 묶음에서 가장 실무적인 변화는 MCP 2026-07-28 specification과 Google Beyond Zero처럼 에이전트가 도구와 데이터에 접근하는 계약을 더 명시적으로 바꾸는 흐름이다. MCP는 session handshake를 없애고 Mcp-Method/Mcp-Name, ttlMs/cacheScope, OAuth/CIMD 마이그레이션을 제시했고, Beyond Zero는 per-resource access decision과 User Intent/Agent Intent 평가를 권한 경계로 끌어올렸다. NVIDIA와 Snowflake는 GPU 시뮬레이션, Feature Store, edge deployment를 agent workflow에 붙이는 사례를 냈고, arXiv 연구들은 RAG와 fine-tuning 평가가 도메인별 실패를 따로 재야 함을 보여준다.
무엇이 달라졌나
- 주요 반복 흐름: Open Source Models/Tooling, Evaluation, Agentic AI
- 핵심 해석: RAG/Data Quality, Agentic AI, Evaluation
- 커뮤니티 인기 신호와 공식/기술 근거를 분리해, 관심도와 사실성을 별도로 읽도록 구성했습니다.
왜 중요한가
- RAG와 agent는 별개 기능이 아니라 같은 품질 체계 안에서 평가해야 합니다.
- 오픈소스 릴리스는 바로 도입보다 breaking change, migration note, benchmark 유무를 먼저 봐야 합니다.
- HN/GeekNews/Lobsters의 인기 글은 시장 관심을 보여주지만, 제품 판단 근거로 쓰기 전 교차 확인이 필요합니다.
커뮤니티 관심 신호
- Kimi K3 weight 공개 (geeknews, GeekNews 최신 큐레이션 신호; RSS에는 추천/댓글 수가 포함되지 않음): 오픈소스 도구 신호입니다. 실제 agent workflow나 inference stack에 붙일 수 있는지 검토하세요.
- A tour of MLIR: The Dialect Stack Everyone Depends On (lobsters-ai, Lobsters engineering discussion 신호; RSS에는 점수/댓글 수가 제한적으로만 포함됨): AI 앱/RAG/agent 엔지니어링 관점에서 retrieval, tool boundary, state, 품질 지표와 연결되는지 확인할 후보입니다.
다음 행동
- MCP client/server에서 initialize handshake, Mcp-Session-Id, DCR 의존을 검색하고 Python SDK 마이그레이션 테스트를 만든다.
- agent tool gateway에는 resource/action 단위 authorization, user intent와 agent intent 로그, prompt injection 리스크 판정을 분리해 기록한다.
- RAG 실험은 retrieval 단독, SFT+RAG, RAFT, chunking 전략을 같은 golden set에서 비교하고 결과를 confidence interval과 함께 남긴다.
- GitHub Trending 후보는 README, license, release, issue activity가 재수집되기 전까지 메일 본문에 올리지 않는다.
전주 대비 흐름
비교 기간: 2026-07-15 ~ 2026-07-21 → 2026-07-22 ~ 2026-07-28
2026-07-22 ~ 2026-07-28에는 오픈소스/도구 신호가 2026-07-15 ~ 2026-07-21보다 늘었습니다.
해석: 2026-07-15 ~ 2026-07-21에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽이 많이 보였고, 2026-07-22 ~ 2026-07-28에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽으로 관심이 옮겨갔습니다. 증가 신호는 RAG/검색/데이터, 평가와 품질 관리, 오픈소스/도구, 연구/논문입니다.
해석 신뢰도: medium
주제 축 변화
- RAG/검색/데이터: 2026-07-22 ~ 2026-07-28 289건 / 2026-07-15 ~ 2026-07-21 267건 / 증가 (+22)
- 평가와 품질 관리: 2026-07-22 ~ 2026-07-28 279건 / 2026-07-15 ~ 2026-07-21 221건 / 증가 (+58)
- 에이전트와 도구 호출: 2026-07-22 ~ 2026-07-28 351건 / 2026-07-15 ~ 2026-07-21 371건 / 감소 (-20)
- 서빙/런타임/운영: 2026-07-22 ~ 2026-07-28 186건 / 2026-07-15 ~ 2026-07-21 159건 / 증가 (+27)
- 보안/거버넌스: 2026-07-22 ~ 2026-07-28 266건 / 2026-07-15 ~ 2026-07-21 237건 / 증가 (+29)
출처 유형 변화
- 기업/공식 발표: 2026-07-22 ~ 2026-07-28 19건 / 2026-07-15 ~ 2026-07-21 30건 / 감소 (-11)
- 오픈소스: 2026-07-22 ~ 2026-07-28 242건 / 2026-07-15 ~ 2026-07-21 206건 / 증가 (+36)
- 커뮤니티 관심: 2026-07-22 ~ 2026-07-28 538건 / 2026-07-15 ~ 2026-07-21 558건 / 감소 (-20)
- 연구/논문: 2026-07-22 ~ 2026-07-28 815건 / 2026-07-15 ~ 2026-07-21 696건 / 증가 (+119)
- 기타: 2026-07-22 ~ 2026-07-28 184건 / 2026-07-15 ~ 2026-07-21 161건 / 증가 (+23)
핫 오픈소스/도구 레이더
geeknews · 2026-07-27
Kimi K3 weight 공개
요약: Moonshot AI의 Kimi K3 페이지는 Kimi K3를 open-weight, native multimodal agentic model로 소개하고 Tech Blog, Full Report, Hugging Face, ModelScope 링크를 함께 제공한다. 본문은 native MXFP4 quantization을 SFT 단계부터 적용했고 MXFP8 activation으로 넓은 하드웨어 호환성을 노렸다고 설명한다.
읽는 법: Hugging Face weight와 full report를 읽고 내부 coding-agent eval에 한두 개 task만 넣어 비용과 품질을 비교한다.
원문 열기원문 링크: https://huggingface.co/moonshotai/Kimi-K3
hnrss-frontpage · 2026-07-27
Benchmarking Opus 5 on SlopCodeBench
요약: HumanLayer 문서는 SlopCodeBench를 모델의 codebase quality 유지 능력 신호로 읽으며, 어떤 모델도 모든 challenge를 complexity 증가 없이 통과하지 못했다고 적었다. Opus 5는 mean complexity가 낮았지만 2000 functions를 작성했다는 tradeoff도 함께 언급한다.
읽는 법: 단독 성능 결론으로 쓰지 말고 LangChain benchmark와 함께 코딩 에이전트 평가 보조 자료로 보관한다.
원문 열기원문 링크: https://github.com/humanlayer/advanced-context-engineering-for-coding-agents/blob/main/benchmarking-opus-5-on-slop-code-bench.md
hnrss-ai · 2026-07-23
Show HN: Claude-thermos keeps your Claude session warm for you
요약: claude-thermos README는 Claude Code main agent가 subagent를 5분 넘게 기다리면 prompt cache가 만료되어 다음 turn에서 전체 대화를 다시 인코딩한다고 설명한다. 도구는 Claude Code를 claude-thermos 래퍼로 실행해 cache를 따뜻하게 유지하고 긴 subagent 세션에서 약 20% 비용 영향을 줄이는 것을 목표로 한다.
읽는 법: README와 pyproject를 더 읽고 도입 대신 cache expiration 관측 지표를 agent runner에 추가할지 검토한다.
원문 열기원문 링크: https://github.com/izeigerman/claude-thermos
커뮤니티 관심 신호
선택된 기사 없음
주요 기사
langchain-blog · 2026-07-23 · official
How We Benchmark Deep Agents
요약: LangChain 글은 deep agents를 개선하려면 robust evaluation과 benchmark를 먼저 갖춰야 한다는 전제로, 장기 agent 작업을 평가 가능한 환경과 채점 가능한 작업으로 구성하는 문제를 다룬다. 패킷의 repeat bundle도 이 글을 최근 에이전트 평가 흐름의 1순위 출처로 둔다.
읽는 법: 글의 benchmark 설계 항목을 내부 golden trace와 실패 taxonomy 템플릿으로 옮긴다.
원문 열기원문 링크: https://www.langchain.com/blog/how-we-benchmark-deep-agents
arxiv-cs-cl · 2026-07-27 · research
Benchmarking Fine-tuning and Retrieval Strategies for a Multimodal Language Model on the NRC Reactor Operator Licensing Examination
요약: 이 연구는 Gemma 4 31B-IT를 NRC Reactor Operator licensing examination에 적용하며 여덟 개 model-retrieval configuration을 비교했다. SFT와 fixed-size chunking RAG 조합은 열네 개 시험 중 여덟 개에서 80% human passing criterion을 넘었지만, fine-tuning 없는 구성은 하나도 통과하지 못했고 aggregate accuracy는 79.7%였다.
읽는 법: 논문 설정을 요약해 RAG/eval wiki에 추가하고 내부 benchmark에 chunking strategy ablation을 하나 넣는다.
원문 열기원문 링크: https://arxiv.org/abs/2607.22067
hnrss-frontpage · 2026-07-27 · research
Show HN: FeyNoBg – Automatic background removal model and training library
요약: Feyn Labs는 FeyNoBg 배경 제거 모델을 소개하며 여덟 개 benchmark 중 네 개에서 최고 published S-measure를 냈고 나머지도 leader와 2% 이내라고 주장했다. 함께 공개한 NoBg는 FeyNoBg 실행과 자체 모델 학습을 위한 Python library이며, Hugging Face 모델, Space, GitHub 저장소, pip install nobg 경로가 제시됐다.
읽는 법: pip 설치와 Hugging Face Space로 작은 샘플을 돌리고 서비스 투입 전에는 자체 이미지셋 S-measure와 latency를 재측정한다.
원문 열기원문 링크: https://usefeyn.com/blog/feynobg
lobsters-ai · 2026-07-24 · community
A tour of MLIR: The Dialect Stack Everyone Depends On
요약: 글은 XLA, Triton, Mojo, Torch-MLIR, IREE, ONNX-MLIR이 MLIR 위에서 각 frontend를 lowering한다고 설명한다. MLIR을 단일 IR이 아니라 SSA, CFG, pass infrastructure, pattern rewriter, location tracking, verification을 공유하는 IR construction kit로 해석한다.
읽는 법: runtime wiki의 배경 자료로 보관하되 메일 상단 promotion보다 인프라 학습 링크로 둔다.
원문 열기원문 링크: https://hiraditya.github.io/posts/mlir-dialect-stack-for-ml
arxiv-cs-cl · 2026-07-28 · research
INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models
요약: INS-ActBench 논문은 기존 benchmark가 domain knowledge, numerical reasoning, long-context, tool use를 분리 평가해 실제 전문 workflow를 충분히 재지 못한다고 본다. 새 benchmark는 16개 actuarial associations의 공개 시험과 sample questions에서 12,050 Q&A pairs를 만들고 knowledge, long-context case reasoning, spreadsheet/R-code practice 세 subset으로 나눴다.
읽는 법: 논문과 GitHub 코드를 읽고 범용 agent eval fixture로 재사용 가능한 subset 구조만 추출한다.
원문 열기원문 링크: https://arxiv.org/abs/2607.24273
추가 핵심 링크
이번 리포트의 핵심 주장을 구현·검증 관점에서 더 확인할 자료입니다.
Llama.cpp vs vLLM: Which Local LLM Engine Actually Scales?
핵심: 로컬 추론 엔진을 개인 하드웨어, 운영 규모, AI 에이전트 워크로드별로 비교합니다.
확인 포인트: 같은 모델·양자화 조건에서 TTFT, tokens/sec, 동시 요청 수, KV cache 사용량을 비교합니다.
Productionize Features Agentic ML in Snowflake
핵심: Cortex Code가 Feature Store의 feature view, training dataset, online serving으로 이어지는 흐름을 보여줍니다.
확인 포인트: 생성 코드의 권한, serving latency, feature freshness, rollback 경로를 검증합니다.
The Types of AI Agent Memory
핵심: working, episodic, semantic, procedural, shared memory를 구분합니다.
확인 포인트: 서비스의 대화 상태, 실행 trace, 장기 지식, workflow 저장소를 분리해 장애 복구와 보존 정책을 점검합니다.
The Secret to Cheaper LLM Inference: NVFP4
핵심: NVFP4로 모델 메모리 footprint를 줄여 더 적은 GPU로 추론하는 방법을 다룹니다.
확인 포인트: 품질 손실, 메모리 절감, batch size, latency를 동일 평가셋에서 재측정합니다.
Developing Healthcare Robotics with GPU-Native Medical Physics Simulation
핵심: Isaac for Healthcare와 Warp, Newton Physics, CUDA, Cosmos-H를 의료 로보틱스 시뮬레이션에 연결합니다.
확인 포인트: 일반 제공 범위, package 통합 방식, tutorial 조건, sim-to-real 차이를 확인합니다.
Expose your site's actions to AI agents using WebMCP
핵심: WebMCP로 에이전트가 UI를 해석하는 대신 사이트의 수행 가능한 action을 직접 노출합니다.
확인 포인트: action schema, 사용자 승인, 권한 범위, 재실행 방지, audit log를 기존 tool gateway와 비교합니다.
다음에 볼 것
- RAG/vector DB/retrieval pipeline에서 freshness, recall, context precision, citation traceability를 어떻게 평가할지 확인
- LangGraph/LangChain/MCP 기반 workflow에서 state transition과 tool boundary를 어떻게 평가할지 확인
- agent/RAG benchmark는 실제 서비스 task, regression trace, security/secret leakage 기준으로 나눠 추적
- 본문이 얇게 수집된 출처는 selector 개선 후 재수집하고 공식 문서로 교차 확인
확인 필요
- 일부 raw Markdown은 feed excerpt 수준이므로 깊은 기술 판단 전 원문 확인 필요
- 커뮤니티 출처는 초기 신호로만 사용하고 공식 출처로 교차 검증 필요
