분석 기간: 2026-09-22 ~ 2026-09-28 · 독자용 상세 리포트
[AIW] 9/28 Agent 운영 경쟁은 런타임 통제와 로컬 모델 라우팅으로 좁혀졌다
요구사항 우선 렌즈
최신 사용자 요구사항을 우선 적용했습니다: Python/LLM 서비스 개발자가 1~4주 안에 실험할 수 있는 SDK/runtime/eval/RAG/tooling · MCP/tool calling/workflow automation/agent framework 변화 · RAG/vector DB/inference/runtime/observability/deployment 변화 · 주요 provider 모델/API/pricing/rate limit/SDK/platform 변경
핵심 메시지
Agent 운영 경쟁은 런타임 통제와 로컬 모델 라우팅으로 좁혀졌다
2026-09-28 확장 선택의 핵심은 특정 Ollaya/Ollama 링크 하나가 아니라, agent를 실제 서비스에 넣기 위한 실행 경계가 여러 출처에서 동시에 구체화됐다는 점입니다. NVIDIA OpenShell은 sandbox, supervisor, credential binding, policy prover로 agent 권한을 workload 밖에서 집행하는 방향을 보여주고, Holo4는 GUI·code·MCP·API를 한 모델이 오가는 computer-use agent와 공개 trajectory/benchmark를 제시합니다. Google Cloud의 Gemma 글은 frontier API만 쓰는 구조에서 벗어나 Ollama/local execution, compact model routing, edge/on-device 배치를 섞는 compound AI stack을 강조합니다. 여기에 AgentXploit, MetaPermit, JevAdvBench, Lev, IBM data-lineage 영상이 붙으면서 이번 리포트의 실무 결론은 모델 발표보다 runtime boundary, eval harness, data lineage, routing economics를 먼저 점검하라는 쪽입니다.
오늘의 핫 뉴스
2026-09-28 기준 새로 눈에 띈 항목을 먼저 배치했습니다. 이후 섹션은 배경, 출처, 실행 항목 순서로 이어집니다.
#1 · Research · arxiv-cs-cl · 2026-09-28
JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated
무슨 뉴스인가: JevAdvBench는 RLCD/Jev류 typed decision 모델이 문장을 생성하지 않고 probability/choice/score를 반환하기 때문에 기존 adversarial benchmark로는 robustness가 잘 측정되지 않는다고 봅니다. 66개 시나리오의 812개 typed questions와 9,744개 single-edit black-box variants로 clean decision 대비 공격 후 결정을 비교합니다.
왜 지금 보나: LLM 서비스에서 typed decision 모델을 routing, moderation, workflow gate에 붙이면 state 자체가 untrusted argued input이 됩니다. confidence threshold로 human review를 라우팅하는 설계도 adversarial state에 의해 흔들릴 수 있음을 보여줍니다.
원문 보기#2 · Signal · 2026-09-28
AgentXploit: Autonomous Repository-to-Runtime Red-Teaming for AI Agents
무슨 뉴스인가: AgentXploit은 AI agent의 저장소 분석과 런타임 공격 확인을 분리한 pre-deployment auditing 시스템입니다. Analyzer Agent가 attacker-controlled input에서 sensitive operation까지의 후보 경로를 찾고, Exploiter Agent가 runtime feedback으로 실제 공격을 다듬는 구조입니다.
왜 지금 보나: agent 보안 검증이 prompt 테스트만으로 끝나지 않고 코드 경로, runtime feedback, 외부 verifier가 결합된 재현 가능한 harness로 이동하고 있습니다. 72개 취약점/12개 open-source agent 시스템이라는 벤치 구성도 내부 red-team fixture 설계에 참고할 만합니다.
원문 보기#3 · Tool · 2026-09-28
MetaPermit: Scalable and Auditable Access Control for AI Agents via LLM-Inferred
무슨 뉴스인가: MetaPermit은 agent tool 호출 권한을 사용자의 의도, 실행 맥락, proposed tool call 사이의 meta-attributes로 분리해 판단하는 access-control 프레임워크입니다. LLM은 meta-attribute를 추론하고, 고정 policy가 allow/deny를 평가해 각 결정을 audit 가능하게 만드는 구조입니다.
왜 지금 보나: LLM-driven authorization은 동적이지만 inconsistent하고 IPI 공격에 취약할 수 있습니다. MetaPermit은 semantic inference와 security enforcement를 분리한다는 점에서 agent permission review를 제품 기능이 아니라 정책/감사 계층으로 설계하게 합니다.
원문 보기한국 AI 커뮤니티 펄스
이번 주에는 어떤 글이 많았나
2026-09-22~2026-09-28 알파카 채널 표본에서는 로컬 LLM을 어떤 장비에서 돌릴지, 어떤 모델/양자화 조합을 쓸지, 실제 앱이나 RAG 엔진으로 어떻게 묶을지가 반복적으로 보였다. DGX Spark는 현재창 16건, 직전 7일 13건으로 계속 많이 보였고, M5 Ultra는 5건 대 3건으로 늘어 하드웨어 선택 글에서 함께 비교됐다. 대표적으로 M5U 256 컷칩을 유지할지 Spark로 바꿀지 묻는 글은 이미지·영상 60%, 대형모델 30%, 바이브코딩 10% 같은 실제 사용 비중과 전기세·가격·CUDA 선호를 함께 놓고 판단하려 했다. Qwen 3.8은 9건 대 14건으로 줄었지만 여전히 벤치와 구동 경험이 남았고, flash는 5건 대 1건으로 늘어 DeepSeek v4.1 flash나 Qwen 계열 flash 실험이 새로 눈에 띄었다. Gemma 4는 4건 대 2건으로 늘었으며, 본문에서는 같은 Gemma 4 계열이라도 양자화 방식에 따라 대화 품질 체감이 다르다는 식의 사용 후기가 확인됐다. 게시물 종류로 보면 하드웨어 구매/전력/가격 상담, 로컬 모바일 앱 구동, RAG·Agentic RAG·검증 게이트 개발기, 모델 벤치/양자화 체감, Qwen4 예고성 소식이 함께 섞인 주간이었다.
이번 주 새로 눈에 띈 이야기
댓글 증거가 있는 활발한 논의는 게시물 빈도와 별도로 제한해 봐야 한다. 댓글 수 기준으로는 '기기 선택 어떤게 나을까요? M5U vs spark'가 45개, '[LLM 로컬 채팅 앱] 안드로이드 로컬 채팅 앱 만드는데..'가 36개, RAG 작업과정 글이 24개, 'M5 Ultra 맥 스튜디오에 대한 단상'이 23개, 24시간 로컬 AI 구동 전기세 질문이 21개로 상위권이었다. 그래서 이번 주 활발한 반응은 '어떤 장비를 사야 하는가', '모바일/로컬에서 실제 응답 지연과 RAM 한계를 어떻게 감당하는가', 'RAG를 단순 검색에서 Agentic RAG·JEV·Hard Gate·Decision Plane으로 확장할 때 무엇을 검증해야 하는가' 쪽으로 읽을 수 있다. 다만 패킷은 댓글 본문을 제공하지 않으므로 찬반이 격렬히 맞붙은 토론이라고 표현하지 않는다. 게시물 수가 많은 DGX Spark나 flash도 관심 신호이지, 댓글 내용까지 검증된 논쟁 신호는 아니다.
근거 글: 기기 선택 어떤게 나을까요? M5U vs spark · [LLM 로컬 채팅 앱] 안드로이드 로컬 채팅 앱 만드는데.. · rag때문에 고충을 토론했던 알못 한국어센세의 작업과정(현재 진행중) · r9700x2 시스템 완성해본김에 qwen3.8 flash next 벤치
관측 기준: 2026-09-22~2026-09-28 동안 Arca Live 알파카 단일 소스에서 URL/제목 기준 중복 제거 글 99건을 분석했습니다. 작성자 정보 확보는 0건(0%)이며, 99건은 서로 다른 작성자 수가 아닙니다. 이전 동일 기간 표본은 111건입니다.
큰 주제별 규모(참고): GPU·하드웨어 구성 37건 · 이전 51건 · 유지, 로컬 추론·양자화 37건 · 이전 40건 · 유지, Qwen 계열 25건 · 이전 23건 · 유지
해석 범위: 빈도와 방향성은 지정된 커뮤니티에서 관측된 게시물 기준입니다. 한국 전체 사용자나 시장 점유율을 대표하지 않습니다. 작성자 정보가 없는 글이 있어 URL/제목 중복 제거는 했지만 작성자 독립성은 완전히 확인하지 못했습니다.
반복 관찰된 흐름
반복 관찰된 흐름
반복되는 흐름은 agent 운영 품질이 더 큰 모델 발표보다 권한 경계, 데이터 흐름, 평가 하네스, typed decision gate로 압축된다는 점입니다. Seal/ACTS는 LLM inference와 eval이 검증 가능한 조건·metadata deprivation을 요구한다는 연구 신호를, Claude Code/Watermarking은 실제 agent 운영에서 instruction loading과 sampling drift가 조용히 동작을 바꿀 수 있다는 운영 리스크를 보여줍니다. 여기에 Jev/Ollaya/Lev/JevAdvBench, MetaPermit/OpenShell/AgentXploit이 붙으면서 반복 신호는 “더 많은 agent 기능”이 아니라 “검증 가능한 실행 경계와 회귀 테스트”로 모입니다.
지난 발송 대비: 이번 확장에서는 NVIDIA Developer Blog, Hugging Face Blog, Google Cloud AI가 들어오면서 반복 신호가 커뮤니티·논문 중심에서 provider/runtime/tooling 근거로 넓어졌습니다. 다만 repeat bundle의 네 출처 자체는 새 독립 뉴스라기보다 이전/반복 관찰 항목을 묶어 현재 본문 초점, 즉 런타임 통제와 로컬 모델 라우팅, agent 평가 하네스가 왜 계속 중요한지 확인해 주는 보조 근거입니다.
장기 흐름: 이번 메일의 주요 항목은 주간/월간 누적 트렌드 메모에도 반영되어, 반복·강화·비판 신호를 다음 리포트에서 이어서 볼 수 있습니다.
읽는 법: 반복 출처 네 개를 별도 새 카드로 다시 읽기보다 내부 체크리스트로 바꾸세요. AGENTS.md/skill 로딩 canary, watermark-on/off paired eval, metadata-full/blind benchmark split, outsourced inference verification 조건을 각각 하나씩 만들어 agent 권한 정책·runtime sandbox·local decision routing 실험과 같이 돌리는 것이 좋습니다.
묶어서 볼 출처
- Seal, Then Sample: Sampled Layerwise Proofs for Verifiable LLM Inference from GPT-2 to 70B · arxiv-cs-cr
- Claude Code reads AGENTS.md only when telemetry is on [fixed] · hnrss-frontpage
- Understanding the Impact of LLM Watermarking on AI Agent Behavior · hnrss-ai
- ACTS: A multi-tier benchmark evaluating LLM cipher identification under controlled blind conditions · arxiv-cs-cr
반복 항목은 개별 카드로 재노출하지 않고, 변화가 있는지와 어떤 체크리스트로 바꿀지만 압축했습니다.
실행 체크리스트
- agent runner의 tool authorization은 LLM 판단 하나에 맡기지 말고 sandbox, supervisor, policy model, audit trail로 분리한다.
- computer-use agent PoC는 Holo4처럼 GUI, code, MCP, API를 한 harness에서 재현하되 OSWorld/AutomationBench 점수와 trajectory 공개 범위를 함께 검증한다.
- frontier API 호출 중 high-volume routing, JSON validation, transcript formatting 같은 deterministic task는 Gemma/Ollama류 local or compact model 후보로 분리해 latency와 margin을 비교한다.
- voice/RAG/security agent는 transcript/audio eval, data lineage, DLP 한계, credential boundary를 같은 체크리스트에 넣어 운영 리스크를 먼저 줄인다.
새로 잡힌 watch 후보
장기 지식으로 확정하기엔 이르지만, 최근성 때문에 확인할 만한 신규 수집 신호입니다.
승격 후보 · microsoft-security-blog · 2026-09-28
NeedyMantis: Unpacking a post-compromise malware family used in targeted operations
이 글 요약: Microsoft Threat Intelligence는 NeedyMantis를 modular post-compromise malware family로 분석하며, 제한된 targeted operations에서 통신사, 대학, 의료 비영리, 정부 contractor 등에 영향이 있었다고 설명합니다. loader, custom encrypted archive, WebSockets C2, IOC, Defender detections, hunting query까지 포함된 상세 공식 분석입니다.
왜 볼 만한가: Defender/Sentinel 환경이 있다면 corp.tripswithengine[.]com, Firefox/21.0 user-agent, WinSparkle/libcurl/vim64 DLL sideloading 쿼리를 우선 점검하세요.
원문 보기소개 · arxiv-cs-cr · 2026-09-28
GitHub Engagement Signals for CVE Prioritization: The GitHub Popularity Metric (GPM)
이 글 요약: GPM 논문은 GitHub stars, forks, unique users 같은 engagement signal을 CVE prioritization에 쓰는 publicly computable metric을 제안합니다. 저자들은 CVSS, EPSS, KEV, SSVC와 비교하고 GPM이 EPSS version 5에 통합됐다고 설명합니다.
왜 볼 만한가: 내부 vuln triage에서 EPSS/KEV 외에 exploit repo popularity가 patch 우선순위를 바꾸는지 샘플링하세요.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기한눈에 보는 판세
무엇이 달라졌나
- 주요 반복 흐름: Open Source Models/Tooling, Agentic AI, Evaluation
- 핵심 해석: RAG/Data Quality, Agentic AI, Evaluation
- 커뮤니티 인기 신호와 공식/기술 근거를 분리해, 관심도와 사실성을 별도로 읽도록 구성했습니다.
왜 중요한가
- RAG와 agent는 별개 기능이 아니라 같은 품질 체계 안에서 평가해야 합니다.
- 오픈소스 릴리스는 바로 도입보다 breaking change, migration note, benchmark 유무를 먼저 봐야 합니다.
- HN/GeekNews/Lobsters의 인기 글은 시장 관심을 보여주지만, 제품 판단 근거로 쓰기 전 교차 확인이 필요합니다.
오픈소스/도구 신호
- Ollaya – Ollama for open-source, Jev-style decision models (hnrss-frontpage, Hotness 37): 로컬 LLM 실험, edge/local inference, 개발자용 smoke test 관련 적용 조건을 확인한다.
커뮤니티 관심 신호
- Introducing Lev (lobsters-ai, Lobsters engineering discussion 신호; RSS에는 점수/댓글 수가 제한적으로만 포함됨): AI 앱/RAG/agent 엔지니어링 관점에서 retrieval, tool boundary, state, 품질 지표와 연결되는지 확인할 후보입니다.
다음 행동
- agent runner의 tool authorization은 LLM 판단 하나에 맡기지 말고 sandbox, supervisor, policy model, audit trail로 분리한다.
- computer-use agent PoC는 Holo4처럼 GUI, code, MCP, API를 한 harness에서 재현하되 OSWorld/AutomationBench 점수와 trajectory 공개 범위를 함께 검증한다.
- frontier API 호출 중 high-volume routing, JSON validation, transcript formatting 같은 deterministic task는 Gemma/Ollama류 local or compact model 후보로 분리해 latency와 margin을 비교한다.
- voice/RAG/security agent는 transcript/audio eval, data lineage, DLP 한계, credential boundary를 같은 체크리스트에 넣어 운영 리스크를 먼저 줄인다.
전주 대비 흐름
비교 기간: 2026-09-15 ~ 2026-09-21 → 2026-09-22 ~ 2026-09-28
2026-09-22 ~ 2026-09-28에는 에이전트와 도구 호출 신호가 2026-09-15 ~ 2026-09-21보다 늘었습니다.
해석: 2026-09-15 ~ 2026-09-21에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽이 많이 보였고, 2026-09-22 ~ 2026-09-28에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽으로 관심이 옮겨갔습니다. 증가 신호는 에이전트와 도구 호출입니다.
해석 신뢰도: medium
주제 축 변화
- RAG/검색/데이터: 2026-09-22 ~ 2026-09-28 332건 / 2026-09-15 ~ 2026-09-21 382건 / 감소 (-50)
- 평가와 품질 관리: 2026-09-22 ~ 2026-09-28 297건 / 2026-09-15 ~ 2026-09-21 336건 / 감소 (-39)
- 에이전트와 도구 호출: 2026-09-22 ~ 2026-09-28 633건 / 2026-09-15 ~ 2026-09-21 576건 / 증가 (+57)
- 서빙/런타임/운영: 2026-09-22 ~ 2026-09-28 263건 / 2026-09-15 ~ 2026-09-21 312건 / 감소 (-49)
- 보안/거버넌스: 2026-09-22 ~ 2026-09-28 477건 / 2026-09-15 ~ 2026-09-21 537건 / 감소 (-60)
출처 유형 변화
- 기업/공식 발표: 2026-09-22 ~ 2026-09-28 31건 / 2026-09-15 ~ 2026-09-21 43건 / 감소 (-12)
- 오픈소스: 2026-09-22 ~ 2026-09-28 264건 / 2026-09-15 ~ 2026-09-21 321건 / 감소 (-57)
- 커뮤니티 관심: 2026-09-22 ~ 2026-09-28 557건 / 2026-09-15 ~ 2026-09-21 583건 / 감소 (-26)
- 연구/논문: 2026-09-22 ~ 2026-09-28 1038건 / 2026-09-15 ~ 2026-09-21 1148건 / 감소 (-110)
- 기타: 2026-09-22 ~ 2026-09-28 249건 / 2026-09-15 ~ 2026-09-21 325건 / 감소 (-76)
핫 오픈소스/도구 레이더
hnrss-frontpage · 2026-09-25
Ollaya – Ollama for open-source, Jev-style decision models
요약: Ollaya는 TypeSafe API와 호환되는 local decision model server로, /v1/systemone과 /v1/models를 제공하고 TypeSafe Python SDK 0.7.1을 그대로 붙일 수 있다고 설명합니다. laya, decider, nli, gliclass, qwen3guard, kev, von 같은 open model catalog와 macOS/Windows/Linux/Docker 실행 경로도 제시합니다.
읽는 법: Ollaya를 watch가 아니라 PoC 후보로 저장하고, JevAdvBench/Lev와 함께 typed decision gate의 평가셋을 구성하세요.
원문 열기최신 근거 하이라이트
arxiv-cs-cl · 2026-09-28
JevAdvBench: A Benchmark and Black-Box Attacks for Reinforcement Learning for Calibrated Decisions Models
요약: JevAdvBench는 RLCD/Jev류 typed decision 모델이 문장을 생성하지 않고 probability/choice/score를 반환하기 때문에 기존 adversarial benchmark로는 robustness가 잘 측정되지 않는다고 봅니다. 66개 시나리오의 812개 typed questions와 9,744개 single-edit black-box variants로 clean decision 대비 공격 후 결정을 비교합니다.
읽는 법: JevAdvBench의 812 typed questions/66 scenarios와 9,744 variants를 확인하고, 내부 routing/moderation decision task에 맞는 축소 벤치를 설계하세요.
원문 열기검증·보안 및 공식 영상
huggingface-blog · 2026-09-28
Holo4: powering generalist computer-use agents
요약: H Company는 Holo4 agentic model series를 공개하며 27B dense와 35B-A3B MoE, Holotron4 Nano, H Models API, FP16/FP8/GGUF weights, trajectory viewer/dataset을 함께 제시합니다. 글은 Holo4가 GUI, code, MCP, API를 한 모델에서 다루고 OSWorld 2.0과 AutomationBench, agentic task factory, long-step harness 개선으로 computer-use agent 성능을 설명합니다.
읽는 법: Holo4 27B/35B-A3B model cards와 trajectory dataset을 저장하고, GUI+MCP+API 혼합 task 한 개를 내부 benchmark로 옮기는 PoC를 설계하세요.
원문 열기youtube-nvidia-developer-official
How to Secure & Run AI Agents with NVIDIA OpenShell
요약: NVIDIA OpenShell 영상은 기존 agent를 다시 쓰지 않고 governed runtime boundary 안에 넣어 filesystem, network, process policy를 binary, destination, method, path 수준으로 통제하는 흐름을 설명합니다. demo는 blocked action, scoped policy update, subagent inheritance, Kubernetes/HA/team grouping, centralized logs까지 다룹니다.
읽는 법: OpenShell은 context source로 포함하고, GitHub repo/tech blog/build 문서로 installation, license, policy parser API를 primary 확인하세요.
원문 열기youtube-microsoft-azure-official
Introducing Voice Agents in Microsoft Foundry Agent Service
요약: Microsoft Foundry Agent Service 영상은 public preview voice agents를 소개하며 speech, models, tools, channels를 하나의 서비스로 묶고 tracing, transcripts, audio evaluation으로 운영 성능을 보는 흐름을 보여줍니다. 설명에는 80+ languages와 140+ locales, web/Teams/telephony 배포, custom voice/avatar도 포함됩니다.
읽는 법: Foundry 문서에서 public preview scope와 SDK/API 제약을 primary 확인하고, voice-agent eval checklist에 tracing/audio evaluation 항목을 추가하세요.
원문 열기youtube-ibm-technology-official
AI Is Exposing Your Data: An AI Security Problem You Can't See
요약: IBM Technology 영상은 AI agents, RAG pipelines, prompts, tools, models를 거치며 민감 데이터가 어떻게 이동·변환·노출되는지 설명합니다. transcript에는 조직의 31%가 AI 관련 사건으로 data privacy breach를 겪었다는 수치, shadow AI, public cloud chatbot에 민감 spreadsheet를 올리는 위험, 기존 DLP만으로는 부족하다는 주장이 나옵니다.
읽는 법: IBM 영상은 context source로 포함하고, 31% breach 수치의 원 연구와 IBM Data Tools 문서를 추적하세요.
원문 열기hnrss-frontpage
Claude Code reads AGENTS.md only when telemetry is on [fixed]
요약: 이 글은 Claude Code 2.1.277/2.1.280의 AGENTS.md 로딩이 tengu_agents_md_mod remote feature flag와 telemetry/nonessential traffic 설정에 묶여 조용히 실패할 수 있었다고 측정합니다. 작성자는 canary word 테스트와 bundle string search로 원인을 확인했고, CLAUDE.md에서 @AGENTS.md를 import하는 workaround를 제시합니다.
읽는 법: confirmed vendor fact가 아니라 measured community report로 다루고, 내부 agent setup guide에 canary test와 fallback import 방식을 추가하세요.
원문 열기nvidia-developer-blog · 2026-09-28
Add Runtime Controls to AI Agents with NVIDIA OpenShell
요약: NVIDIA는 OpenShell 0.1.0을 기존 AI agent에 덧씌울 수 있는 open-source runtime control 계층으로 설명합니다. 본문은 Gateway, Supervisor, Sandbox가 agent workload 밖에서 filesystem, process, network, HTTP/GraphQL/MCP 요청을 정책으로 제한하고 credential binding과 OCSF audit trail, policy prover로 권한 변경을 검증하는 흐름을 제시합니다.
읽는 법: OpenShell quickstart와 GitHub repository를 열어 sandbox policy YAML, provider binding, policy advisor, OCSF audit trail 예제를 PoC 후보로 분해하세요.
원문 열기google-cloud-ai · 2026-09-28
Why your startup needs open models alongside frontier APIs
요약: Google Cloud는 production AI architecture에서 모든 요청을 frontier model로 보내는 전략이 latency, infrastructure overhead, margin erosion을 만든다고 보고, Gemini와 Gemma를 함께 쓰는 compound AI stack을 제안합니다. 본문은 Gemma 4의 Apache 2.0 license, E2B/E4B/12B/26B-A4B/31B 라인업, function calling, 256K context, Ollama 기반 Cue 사례의 44% latency drop, edge/local execution과 high-throughput agent routing 용도를 제시합니다.
읽는 법: Gemma 4 license/model docs, Ollama 배포 경로, Cue latency 원문, Google AI Studio/Model Garden serving 조건을 확인해 local-model routing 실험표를 만드세요.
원문 열기lobsters-ai
Introducing Lev
요약: Lev 글은 Jev-style decision engine을 로컬 open model로 구현하고, 빠른 encoder tier와 local thinking LLM escalation tier를 결합하는 설계를 설명합니다. 작성자는 adversarial 144-case set, confidence gate, per-type threshold, calibration refit, debias mode, snake example까지 상세히 제시합니다.
읽는 법: Lev repo를 PoC 후보로 저장하고, Ollaya와 함께 local decision-runtime 비교표를 만드세요.
원문 열기youtube-nvidia-developer-official
Ask the Experts: Evaluating Agent Skills | Nemotron Labs
요약: NVIDIA Nemotron Labs 영상은 agent skills가 instructions, examples, tool guidance를 패키징하지만 실제 workflow에 넣기 전에 usefulness, overlap, security risk를 평가해야 한다고 설명합니다. description에는 SkillEvaluator의 three-tier evaluation framework와 SkillSpector의 prompt injection, data exfiltration, trigger abuse, tool poisoning scan이 제시됩니다.
읽는 법: watch로 포함하고, SkillEvaluator/SkillSpector repo와 문서가 확보되면 장기 맥락 승격을 재평가하세요.
원문 열기youtube-google-developers-official
The next generation of voice AI with Google DeepMind and Sierra AI
요약: Google Developers 영상은 DeepMind와 Sierra AI가 native audio model, conversational latency, multilingual code-switching, agentic voice task, real-world dialogue benchmark를 논의합니다. 설명은 Word Error Rate를 넘어 conversational flow와 turn-taking을 측정해야 한다는 방향을 제시합니다.
읽는 법: watch로 포함하고, DeepMind/Sierra 제품 문서 또는 benchmark 원문이 확보되면 factual claim을 재평가하세요.
원문 열기주요 기사
hnrss-ai · 2026-09-26 · research
Understanding the Impact of LLM Watermarking on AI Agent Behavior
요약: Lasso Security 글은 SynthID-Text류 generation-time watermarking이 provenance에는 유용하지만, agent가 실행할 tool call과 refusal token 선택도 바꿀 수 있다고 실험합니다. BFCL tool calling과 HarmBench/JailbreakBench refusal 실험에서 paired disagreement/churn을 별도로 보고합니다.
읽는 법: watch로 유지하고, Anthropic/DeepMind primary docs와 실제 provider setting을 확인한 뒤 내부 eval checklist에 추가하세요.
원문 열기arxiv-cs-cr · 2026-09-24 · research
ACTS: A multi-tier benchmark evaluating LLM cipher identification under controlled blind conditions
요약: ACTS는 cipher identification 능력을 Tier-1 full metadata, Tier-2 filename only, Tier-3 completely blind로 나눠 평가하고, forced reasoning/code-as-reasoning/self-correction도 별도로 봅니다. 완전 blind Tier-3 combined accuracy는 30.8%로 seven-way random baseline 14.3%보다 약간 높고, Tier-1 대비 metadata-dependency gap은 40.9 percentage points입니다.
읽는 법: 이번 발송에서는 research watch로 낮추고, eval harness 설계 시 metadata deprivation 패턴을 참고하세요.
원문 열기다음에 볼 것
- RAG/vector DB/retrieval pipeline에서 freshness, recall, context precision, citation traceability를 어떻게 평가할지 확인
- LangGraph/LangChain/MCP 기반 workflow에서 state transition과 tool boundary를 어떻게 평가할지 확인
- agent/RAG benchmark는 실제 서비스 task, regression trace, security/secret leakage 기준으로 나눠 추적
- 본문 근거가 부족한 출처는 원문과 공식 문서로 다시 확인
확인 필요
- 일부 출처는 짧은 요약만 확보되어 있으므로 깊은 기술 판단 전 원문 확인 필요
- 커뮤니티 출처는 초기 신호로만 사용하고 공식 출처로 교차 검증 필요
'관심있는 주제 > AI뉴스' 카테고리의 다른 글
| AI 개발자 레이더 2026-09: 모델 경쟁을 넘어, 에이전트의 권한·평가·제어 평면이 실전 기준이 된 달 (0) | 2026.10.01 |
|---|---|
| AI 개발자 레이더 2026-09-29: Agent 보안 경쟁은 런타임 격리와 평가 하네스로 갈린다 (0) | 2026.09.30 |
| AI 개발자 격주 레이더 2026-09-14~2026-09-27: 에이전트가 똑똑해질수록, 운영 경계가 중요해졌다 (0) | 2026.09.29 |
| AI 개발자 레이더 2026-09-27: AI 서비스 평가는 게이트웨이·데이터 격리·Model Serving 검증으로 이동했다 (0) | 2026.09.28 |
| AI 개발자 레이더 2026-09-26: 에이전트 운영의 다음 승부처는 DNS 통제·게이트웨이·런타임 평가다 (0) | 2026.09.27 |
