분석 기간: 2026-09-13 ~ 2026-09-19 · 독자용 상세 리포트
[AIW] 9/19 Anthropic 평가·Claude Code AGENTS.md·TensorRT가 agent 운영 기준을 바꿨다
요구사항 우선 렌즈
최신 사용자 요구사항을 우선 적용했습니다: Python/LLM 서비스 개발자가 1~4주 안에 실험할 수 있는 SDK/runtime/eval/RAG/tooling · MCP/tool calling/workflow automation/agent framework 변화 · RAG/vector DB/inference/runtime/observability/deployment 변화 · 주요 provider 모델/API/pricing/rate limit/SDK/platform 변경
핵심 메시지
Anthropic 평가·Claude Code AGENTS.md·TensorRT가 agent 운영 기준을 바꿨다
이번 7일 창의 강한 신호는 agent 운영 기준이 demo에서 검증 가능한 증거로 이동했다는 점이다. Anthropic은 Accenture/Faculty를 embedded evaluator로 들여 red-teaming, alignment assessment, safeguard testing을 맡기고 5년간 양측 각 최소 10억 달러 투자를 말한다. Claude Code의 AGENTS.md fallback과 LangChain Jev harness는 agent 개발 표준을 repository-local rule과 evaluation loop로 묶고, NVIDIA AIPerf와 TensorRT Edge-LLM은 inference/runtime benchmark를 배포 판단의 중심으로 끌어올렸다. Google Mantis는 92% 초과 precision, 일부 3% false-positive, 1분 미만 triage를 제시했고, IBM/Hugging Face는 Mean@5 77.4%와 Pass^5 53.0%의 24.4pp gap으로 반복 실행 안정성까지 평가해야 함을 수치화했다.
오늘의 핫 뉴스
2026-09-19 기준 새로 눈에 띈 항목을 먼저 배치했습니다. 이후 섹션은 배경, 출처, 실행 항목 순서로 이어집니다.
#1 · Signal · 2026-09-19
I built non-autoregressive decision models with RL a year ago
무슨 뉴스인가: Nandakishor Mukkunnoth의 글은 1년 전 구축한 non-autoregressive decision model과 RL 실험을 설명하며 ConvAI Innovations, 그림 기반 설명, 12분 읽기 분량의 구현 회고를 제공한다. sequence generation보다 decision model 쪽으로 문제를 재구성하는 접근이 핵심이다.
왜 지금 보나: agent 의사결정을 모든 문제에 LLM text generation으로 밀어붙이지 말고, bounded decision과 reward/eval 설계를 분리하라는 실무 신호다. CUA-S1의 System 1 decision model 흐름과도 이어진다.
원문 보기#2 · Tool · 2026-09-19
알리바바, 보고 듣고 행동하는 옴니모달 '큐원3.8-옴니-플래시' 공개
무슨 뉴스인가: AI타임스는 알리바바가 Qwen3.8-Omni-Flash를 공개했다고 보도했다. 기사 기준으로 이 모델은 텍스트·이미지·오디오·비디오 입력, 최대 100만 토큰 컨텍스트, 함수 호출·웹 검색·구조화 출력·컨텍스트 캐싱·배치 호출을 지원한다.
왜 지금 보나: 보고 듣는 수준을 넘어 도구 호출과 작업 수행까지 연결하려는 옴니모달 agent 흐름이어서 LLM 서비스 개발자가 API 범위와 비용 구조를 확인할 가치가 있다. 다만 기사에는 출시 시점 가중치 미공개, 호스팅 API 제공이라는 제한도 함께 적혀 있어 배포 판단은 공식 모델 카드로 재확인해야 한다.
원문 보기#3 · Signal · 2026-09-19
Z.ai “AI가 AI 실행 인프라 스스로 구축...'재귀적 자기개선'의 시작”
무슨 뉴스인가: AI타임스는 Z.ai가 GLM-5.3 기반 인프라 에이전트로 GLM-5.3-Flash 추론 시스템을 구축·최적화한 사례를 보도했다. 기사 기준으로 중국산 AI 가속기 10만개 이상 클러스터, 생산 환경 투입까지 2주 미만, 초기 대비 처리량 약 3배 증가가 핵심 수치다.
왜 지금 보나: LLM 서비스 운영에서 agent가 코드 작성뿐 아니라 성능 측정, 원인 추적, 개선안 시험을 반복하는 흐름을 보여준다. 다만 기사도 아직 후속 모델을 스스로 설계·학습하는 RSI 단계는 아니며 최종 목표 설정과 위험 판단은 인간의 몫이라고 선을 긋는다.
원문 보기한국 AI 커뮤니티 펄스
2026-09-13~2026-09-19 동안 Arca Live 알파카 단일 소스에서 URL/제목 기준 중복 제거 글 106건을 분석했습니다. 작성자 정보 확보는 0건(0%)이며, 106건은 서로 다른 작성자 수가 아닙니다. 이전 동일 기간 표본은 112건입니다.
- GPU·하드웨어 구성 — 중복 제거 글 50건 · 이전 41건 · 유지
- 로컬 추론·양자화 — 중복 제거 글 35건 · 이전 36건 · 유지
- 런타임·서빙 — 중복 제거 글 27건 · 이전 18건 · 증가
- 비용·전력·발열 — 중복 제거 글 24건 · 이전 29건 · 유지
- Qwen 계열 — 중복 제거 글 23건 · 이전 28건 · 유지
- Llama 계열 — 중복 제거 글 18건 · 이전 12건 · 증가
- 코딩 에이전트 — 중복 제거 글 17건 · 이전 19건 · 유지
- 서비스 운영·안정성 — 중복 제거 글 16건 · 이전 12건 · 유지
누가 무엇을 보는가
- 로컬 모델 사용자: Qwen 계열, DeepSeek 계열, GLM 계열, Gemma 계열
- LLM 서비스 개발자: 런타임·서빙, 서비스 운영·안정성, 벤치마크·품질 검증, 코딩 에이전트
- 기업·플랫폼 개발자: 서비스 운영·안정성, 벤치마크·품질 검증, 비용·전력·발열, 코딩 에이전트
해석 범위: 빈도와 방향성은 지정된 커뮤니티에서 관측된 게시물 기준입니다. 한국 전체 사용자나 시장 점유율을 대표하지 않습니다. 작성자 정보가 없는 글이 있어 URL/제목 중복 제거는 했지만 작성자 독립성은 완전히 확인하지 못했습니다.
반복 관찰된 흐름
Anthropic·Claude Code·TensorRT로 반복 확인된 agent 운영 기준
반복되는 흐름은 agent와 LLM runtime을 더 많이 붙이는 것이 아니라, 그것을 어떤 benchmark·권한·privacy·validation 증거로 운영할지다. AIPerf와 TensorRT Edge-LLM은 inference 측정을 요구하고, Claude Code AGENTS.md와 LangChain Jev는 agent 개발 표준을 repository rule과 harness로 묶는다. Anthropic embedded evaluation, Baseten 권한 사례, ResumeShield, local privacy, fingerprinting 연구는 같은 문제를 보안·평가 경계에서 반복한다.
지난 발송 대비: 이번에는 Anthropic의 embedded evaluation 파트너십, Claude Code AGENTS.md fallback, NVIDIA AIPerf/TensorRT, LangChain Jev, Baseten 권한 사례, Trail of Bits benchmark 비판, ResumeShield가 agent 운영 품질을 더 source-backed하게 보강했다. CUA-S1과 Stagehand는 watch 후보로 남겼지만, top 결론에는 넣지 않았다.
장기 흐름: 이번 메일의 주요 항목은 주간/월간 누적 트렌드 메모에도 반영되어, 반복·강화·비판 신호를 다음 리포트에서 이어서 볼 수 있습니다.
읽는 법: 반복 출처를 내부 checklist로 바꾼다: evaluator access, AGENTS.md/Claude.md fallback, sandbox cleanup, tool/action boundary, GitHub token scope, benchmark fixture, prompt-injection channel separation, inference telemetry 중 빠진 항목 하나를 다음 스프린트 검증 작업으로 잡는다.
묶어서 볼 출처
- Benchmarking LLM Inference at Scale with AIPerf · nvidia-developer-blog
- TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor · nvidia-developer-blog
- Claude Code now reads AGENTS.md if there is no Claude.md · hnrss-frontpage
- Building a Harness with Jev · langchain-blog
- We got admin access to Baseten production GitHub in 25 minutes · hnrss-frontpage
- ResumeShield: Channel Separation and an Open Benchmark for Indirect Prompt Injection in AI Resume Screening ·
- 1Password AI patching benchmark is misleading · trail-of-bits-security
- Partnering with Accenture on embedded evaluation · anthropic-news
반복 항목은 개별 카드로 재노출하지 않고, 변화가 있는지와 어떤 체크리스트로 바꿀지만 압축했습니다.
실행 체크리스트
- agent feature 선정 시 모델명보다 evaluation access, red-team 절차, safeguard report boundary를 먼저 요구한다.
- agent runtime은 container 편의성만 보지 말고 microVM/gVisor 격리, egress policy, suspend/resume latency, idle density를 비교한다.
- agent benchmark는 Mean@k와 함께 Pass^k 또는 반복 실행 consistency gap을 보고, trace 기반 guideline/repair 루프를 별도 품질 지표로 둔다.
- RAG/search는 vector-only 구성을 피하고 BM25/keyword exact match와 ScaNN/HNSW/RRF 같은 hybrid retrieval 조건을 점검한다.
새로 잡힌 watch 후보
장기 지식으로 확정하기엔 이르지만, 최근성 때문에 확인할 만한 신규 수집 신호입니다.
소개 · sglang-releases · 2026-09-18
v0.5.20
이 글 요약: SGLang v0.5.20 릴리스는 GitHub release 본문 추출이 UI chrome에 많이 섞여 있지만, serving/runtime 업데이트가 계속되고 있다는 신호다. 본문에는 signed change notification, release tag, 공개 저장소 메타데이터가 보인다.
왜 볼 만한가: v0.5.20에서 scheduler, quantization, API compatibility, serving benchmark 중 실제 변경이 무엇인지 확인한다.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기한눈에 보는 판세
무엇이 달라졌나
- 주요 반복 흐름: Agentic AI, Evaluation, Open Source Models/Tooling
- 핵심 해석: RAG/Data Quality, Agentic AI, Evaluation
- 커뮤니티 인기 신호와 공식/기술 근거를 분리해, 관심도와 사실성을 별도로 읽도록 구성했습니다.
왜 중요한가
- RAG와 agent는 별개 기능이 아니라 같은 품질 체계 안에서 평가해야 합니다.
- 오픈소스 릴리스는 바로 도입보다 breaking change, migration note, benchmark 유무를 먼저 봐야 합니다.
- HN/GeekNews/Lobsters의 인기 글은 시장 관심을 보여주지만, 제품 판단 근거로 쓰기 전 교차 확인이 필요합니다.
커뮤니티 관심 신호
- Model Training Incidents are Negligence (lobsters-ai, Lobsters engineering discussion 신호; RSS에는 점수/댓글 수가 제한적으로만 포함됨): 오픈소스 도구 신호입니다. 실제 agent workflow나 inference stack에 붙일 수 있는지 검토하세요.
다음 행동
- agent feature 선정 시 모델명보다 evaluation access, red-team 절차, safeguard report boundary를 먼저 요구한다.
- agent runtime은 container 편의성만 보지 말고 microVM/gVisor 격리, egress policy, suspend/resume latency, idle density를 비교한다.
- agent benchmark는 Mean@k와 함께 Pass^k 또는 반복 실행 consistency gap을 보고, trace 기반 guideline/repair 루프를 별도 품질 지표로 둔다.
- RAG/search는 vector-only 구성을 피하고 BM25/keyword exact match와 ScaNN/HNSW/RRF 같은 hybrid retrieval 조건을 점검한다.
전주 대비 흐름
비교 기간: 2026-09-06 ~ 2026-09-12 → 2026-09-13 ~ 2026-09-19
2026-09-13 ~ 2026-09-19에는 보안/거버넌스 신호가 2026-09-06 ~ 2026-09-12보다 늘었습니다.
해석: 2026-09-06 ~ 2026-09-12에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽이 많이 보였고, 2026-09-13 ~ 2026-09-19에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽으로 관심이 옮겨갔습니다. 증가 신호는 RAG/검색/데이터, 평가와 품질 관리, 기업/공식 발표, 오픈소스/도구입니다.
해석 신뢰도: medium
주제 축 변화
- RAG/검색/데이터: 2026-09-13 ~ 2026-09-19 358건 / 2026-09-06 ~ 2026-09-12 324건 / 증가 (+34)
- 평가와 품질 관리: 2026-09-13 ~ 2026-09-19 331건 / 2026-09-06 ~ 2026-09-12 291건 / 증가 (+40)
- 에이전트와 도구 호출: 2026-09-13 ~ 2026-09-19 567건 / 2026-09-06 ~ 2026-09-12 554건 / 증가 (+13)
- 서빙/런타임/운영: 2026-09-13 ~ 2026-09-19 297건 / 2026-09-06 ~ 2026-09-12 283건 / 증가 (+14)
- 보안/거버넌스: 2026-09-13 ~ 2026-09-19 555건 / 2026-09-06 ~ 2026-09-12 466건 / 증가 (+89)
출처 유형 변화
- 기업/공식 발표: 2026-09-13 ~ 2026-09-19 31건 / 2026-09-06 ~ 2026-09-12 17건 / 증가 (+14)
- 오픈소스: 2026-09-13 ~ 2026-09-19 302건 / 2026-09-06 ~ 2026-09-12 274건 / 증가 (+28)
- 커뮤니티 관심: 2026-09-13 ~ 2026-09-19 584건 / 2026-09-06 ~ 2026-09-12 484건 / 증가 (+100)
- 연구/논문: 2026-09-13 ~ 2026-09-19 1142건 / 2026-09-06 ~ 2026-09-12 1022건 / 증가 (+120)
- 기타: 2026-09-13 ~ 2026-09-19 309건 / 2026-09-06 ~ 2026-09-12 294건 / 증가 (+15)
핫 오픈소스/도구 레이더
hnrss-frontpage · 2026-09-15
We got admin access to Baseten's production GitHub in 25 minutes
요약: Strix 글은 Baseten의 production GitHub에 25분 만에 admin access를 얻었다고 주장하며 Harbor/GitHub PAT takeover 흐름을 설명한다. HN은 discovery 신호이고, 본문 anchor에는 Baseten, GitHub repos, admin access, Alex Schapiro가 보인다.
읽는 법: 내 조직의 GitHub app/PAT 권한을 admin/write/read로 분리하고, agent runner가 production repo에 닿는 경로를 inventory한다.
원문 열기최신 근거 하이라이트
hnrss-frontpage · 2026-09-19
I built non-autoregressive decision models with RL a year ago
요약: Nandakishor Mukkunnoth의 글은 1년 전 구축한 non-autoregressive decision model과 RL 실험을 설명하며 ConvAI Innovations, 그림 기반 설명, 12분 읽기 분량의 구현 회고를 제공한다. sequence generation보다 decision model 쪽으로 문제를 재구성하는 접근이 핵심이다.
읽는 법: 내 agent workflow에서 반복 판단 하나를 골라 reward, state, action space로 재정의할 수 있는지 실험 후보를 만든다.
원문 열기검증·보안 및 공식 영상
youtube-nvidia-developer-official
Scikit-Learn Spectral Clustering — 100x Faster with NVIDIA cuML
요약: NVIDIA Developer Shorts는 scikit-learn spectral clustering을 cuML GPU acceleration으로 실행해 50,000개 options risk regime clustering 예시를 보여준다. 설명에는 benchmark notebook 링크가 있고, transcript는 CPU에서 minutes가 걸리던 작업이 GPU에서 seconds, 대규모 options data에서는 200배 이상 빠를 수 있다고 말한다.
읽는 법: notebook을 열어 내 데이터 clustering workload에서 CPU baseline과 cuML baseline을 같은 metric으로 비교한다.
원문 열기youtube-ibm-technology-official
The vulnpocalypse might not be so bad after all
요약: IBM Technology의 Security Intelligence 영상은 AI-driven vulnpocalypse를 과장과 실제 변화 사이에 놓고, patching보다 validation으로 초점을 옮겨야 한다고 토론한다. 설명과 transcript에는 AI agents의 secret message boards, ShinyHunters vishing, quantum/AI threats와 cyber resilience까지 묶여 있다.
읽는 법: 보안 자동화 backlog에서 patch 생성 수보다 validation fixture와 incident response evidence를 우선순위로 둔다.
원문 열기youtube-nvidia-developer-official
Dense vs. MoE: How to Choose the Right AI Architecture
요약: NVIDIA Developer Shorts는 dense model과 MoE가 parameter를 쓰는 방식과 deployment trade-off를 설명한다. transcript는 dense는 모든 parameter를 매 token 활성화해 단순하고 일관적이며, MoE는 router가 expert를 선택해 high-volume agentic workload에서 속도를 얻는 대신 routing/serving complexity가 생긴다고 설명한다.
읽는 법: 모델 선택 문서에 dense/MoE 기준을 speed, quality, memory, routing complexity로 나눠 적고 serving benchmark를 붙인다.
원문 열기youtube-microsoft-developer-official
What if an agent could refactor your agent?
요약: Microsoft Developer 영상은 이미 만든 cupcake ordering agent를 GitHub Copilot과 microsoft-foundry skill로 검토하고, Foundry-aware refactor를 제안하게 하는 흐름을 보여준다. 영상 설명은 best-practice gaps, toolbox/observability upgrade, Agent Inspector test, production-ready recap을 단계로 제시한다.
읽는 법: 내 agent repo에도 provider별 skill/review checklist를 만들어 Copilot/Codex가 같은 best-practice 기준으로 diff를 제안하게 한다.
원문 열기hnrss-frontpage
Claude Code now reads AGENTS.md if there is no Claude.md
요약: Claude Code changelog는 Claude.md가 없을 때 AGENTS.md를 읽는 지원이 추가됐다고 기록한다. 2026-09-18 changelog의 2.1.277 항목으로, repository-level agent instruction 호환성이 넓어지는 작은 변경이다.
읽는 법: 현재 repo의 AGENTS.md를 Claude Code/Codex 공통 기준으로 읽힐 때도 안전한지 점검하고, tool 권한·테스트 명령·금지 패턴을 분리한다.
원문 열기anthropic-news · 2026-09-18
Sep 18, 2026 Announcements Partnering with Accenture on embedded evaluation
요약: Anthropic은 Accenture의 AI 전문 조직 Faculty와 frontier AI embedded evaluation 파트너십을 발표했다. 범위는 model evaluation, red-teaming, alignment assessment, safeguard testing이며, embedded evaluator는 직원에 가까운 access로 training 중인 모델과 deployment decision을 관찰하는 구상이다. Anthropic과 Accenture는 향후 5년간 각자 최소 10억 달러를 이 역량에 투자할 것으로 밝혔다.
읽는 법: frontier model 또는 Claude 계열을 도입할 때 vendor에게 embedded evaluation report, red-team coverage, safeguard regression 공개 범위를 요구한다.
원문 열기google-cloud-ai · 2026-09-18
Changing the game: Using agentic AI to secure infrastructure code
요약: Google AI and Infrastructure 팀은 모든 infrastructure code change를 pre-submit 단계에서 agentic scan으로 검사하는 방식을 설명했다. Mantis 기반 multi-agent review harness와 localized threat model, AST/call-graph/domain safety rule triage를 결합해 triage agent가 92% 초과 precision으로 1분 미만에 reachable vulnerable path를 검증하고, 일부 case에서 false positive를 3%까지 낮췄다고 밝혔다.
읽는 법: security agent PoC는 finding 생성보다 AST/call graph validator와 false-positive metric부터 설계한다.
원문 열기google-cloud-ai · 2026-09-18
Announcing Native BM25 Ranking in AlloyDB and Cloud SQL
요약: Google Cloud는 AlloyDB와 Cloud SQL for PostgreSQL 17+에 native BM25 index preview를 발표했다. Tiger Data의 open-source pg_textsearch extension을 통해 BM25 ranking을 Postgres table 안에서 실행하고, AlloyDB는 ScaNN/HNSW vector index와 hybrid_search UDF, RRF로 keyword/vector 결과를 합칠 수 있다고 설명한다.
읽는 법: RAG app에서 exact identifier miss가 있으면 separate search backend 대신 pg_textsearch/BM25 + vector hybrid 구성을 PoC한다.
원문 열기google-cloud-ai · 2026-09-15
Agent Substrate brings high-density, scalable, trusted infrastructure to GKE
요약: Google Cloud는 Agent Substrate on GKE availability를 발표했다. Agent Substrate는 Kubernetes 기반 agent execution runtime으로 microVM 또는 gVisor sandbox, egress proxy, credential injection boundary를 제공하고, sub-500ms resume, 초당 500회 이상 suspend/resume activation, 호스트당 1,000개 이상 dormant agent, standard container runtime 대비 10x density를 주장한다.
읽는 법: 장시간 대기하는 coding/browser agents를 운영한다면 resume latency, dormant density, egress control을 기존 Kubernetes Pod lifecycle과 비교한다.
원문 열기huggingface-blog · 2026-09-15
Your Agent Aced the Task. Will It Do It Again?
요약: IBM Research/Hugging Face 글은 agent evaluation에서 Mean@5와 Pass^5를 분리해야 한다고 주장한다. AppWorld test_normal에서 GPT-4.1 ReAct agent는 Mean@5 77.4%였지만 all five runs 성공 기준 Pass^5는 53.0%라 24.4pp consistency gap이 있었고, ALTK-Evolve consistency guidelines로 gap을 12.0pp까지 줄였다고 보고했다.
읽는 법: agent eval report에 Mean@k와 Pass^k를 함께 넣고, unstable trajectory에서 guideline repair를 생성하는 regression loop를 추가한다.
원문 열기youtube-google-developers-official · 2026-09-15
What's new in the Gemini Live API
요약: Google for Developers 영상은 Gemini Live API 업데이트로 async function calling, proactive audio, send_client_content context injection, background/high reasoning을 소개한다. demo에서는 order ID 1234XYZ 조회 같은 long-running tool call을 background에서 처리하면서 대화를 유지하고, high reasoning model이 SVG 생성 작업을 background로 진행하면서 native audio 응답성을 유지하는 흐름을 보여준다.
읽는 법: voice agent PoC에서 tool call latency 동안 conversation responsiveness와 context injection side effect를 테스트한다.
원문 열기hnrss-frontpage
How OpenAI Used Its Own LLMs to Design Its Jalapeño Chip
요약: IEEE Spectrum 보도는 OpenAI가 자체 LLM을 활용해 Jalapeño chip 설계 workflow를 만들었다는 내용을 다룬다. 본문 anchor에는 OpenAI, Jalapeño, end-to-end latency reduction, benchmark 인용이 보인다.
읽는 법: 칩 설계 자동화 사실은 원 논문이나 OpenAI 공식 자료로 확인되기 전까지 context source로만 보존한다.
원문 열기arxiv-cs-cr
Towards TEE-Certified DP: Verifiable Differentially Private Training on Legacy GPUs
요약: Towards TEE-Certified DP는 민감한 training data를 보호하기 위해 DP 실행을 외부 검증 가능하게 만드는 문제를 다룬다. CPU-side TEE와 untrusted GPU를 함께 쓰고, gradient DP enforcement를 probabilistic checking으로 검증한다는 abstract가 확인된다.
읽는 법: regulated data로 fine-tuning하는 팀은 DP claim을 문서화할 때 TEE/verification 요구를 watchlist에 넣는다.
원문 열기lobsters-ai
Model Training Incidents are Negligence
요약: Lobsters에 올라온 Model Training Incidents are Negligence는 model training failure를 단순 사고가 아니라 운영 책임 문제로 보는 글이다. community discussion 신호라 원문 주장은 확인해야 하지만, training incident를 governance와 accountability로 보는 관점이 보인다.
읽는 법: 모델 학습 runbook에 데이터 변경, eval regression, rollback, 책임자 승인 항목이 있는지 점검한다.
원문 열기openai-news · 2026-09-14
Perplexity trusts GPT-6 Astra with end-to-end systems
요약: OpenAI는 Perplexity가 GPT-6 Astra를 communications 작성, real-world systems edit, production software monitoring, end-to-end testing program 생성에 쓴다고 소개했다. Perplexity 측은 이전 세대보다 check-in을 훨씬 덜 해도 full end-to-end systems를 맡길 수 있다고 말했다.
읽는 법: Astra류 agent를 평가할 때 code generation benchmark 외에 mock service generation과 end-to-end workflow testing checklist를 추가한다.
원문 열기주요 기사
nvidia-developer-blog · 2026-09-18 · official
Benchmarking LLM Inference at Scale with AIPerf
요약: NVIDIA 공식 블로그는 AIPerf로 대규모 LLM inference를 benchmark하는 방법을 소개한다. GenAI-Perf 후속 맥락에서 endpoint 유형, workload, arrival pattern, latency/throughput, GPU telemetry를 함께 보는 방향이 핵심이다.
읽는 법: AIPerf 문서를 읽고 현재 inference benchmark에 TTFT, ITL, output throughput, GPU telemetry를 추가한다.
원문 열기nvidia-developer-blog · 2026-09-16 · official
TensorRT Edge-LLM Completes the MLPerf Edge Agentic Benchmark 6.4x Faster on Jetson AGX Thor
요약: NVIDIA는 TensorRT Edge-LLM이 Jetson AGX Thor에서 MLPerf Edge Agentic Benchmark를 6.4배 빠르게 완료했다고 발표한다. Edge device에서 agentic benchmark와 TensorRT 최적화를 연결한 공식 runtime 성능 신호다.
읽는 법: edge agent PoC가 있다면 TensorRT Edge-LLM의 지원 모델과 deployment path를 검토하되, 내부 workload로 재측정한다.
원문 열기langchain-blog · 2026-09-17 · official
Building a Harness with Jev
요약: LangChain의 Building a Harness with Jev는 agent architecture와 evaluation harness를 함께 다룬다. 본문 anchor에는 Open Agent Architecture, LangChain, primitives, harness가 확인된다.
읽는 법: 현재 agent workflow 하나에 대해 happy path가 아니라 failure fixture와 review command를 먼저 작성한다.
원문 열기arxiv-cs-cr · 2026-09-17 · research
The Illusion of Local Privacy: Confidentiality Boundary Failures in Consumer LLM Serving Systems
요약: The Illusion of Local Privacy는 consumer LLM serving system의 confidentiality boundary failure를 다룬다. 제목과 source anchors는 local privacy, boundary failures, consumer LLM serving을 직접 가리킨다.
읽는 법: 내 서비스의 local/private mode에서 외부 호출, 로그, crash report, 검색 플러그인이 꺼지는지 테스트 케이스를 추가한다.
원문 열기arxiv-cs-cr · 2026-09-17 · research
ASLEval: Measuring Privacy Exposure Displacement in LLM Agent Sessions
요약: ASLEval은 LLM agent session에서 privacy exposure displacement를 측정하려는 평가 논문이다. session, privacy exposure, displacement라는 문제 설정이 핵심이다.
읽는 법: agent memory/tool log에서 민감 정보가 단계 간 이동하는지 보는 regression fixture를 만든다.
원문 열기trail-of-bits-security · 2026-09-15 · research
1Password's AI patching benchmark is misleading
요약: Trail of Bits는 1Password의 AI patching benchmark가 misleading하다고 비판한다. 본문 anchor는 defenders를 less effective하게 만들 위험과 benchmark가 방어자를 잘못 유도할 수 있다는 문제를 짚는다.
읽는 법: 보안 자동화 benchmark를 채택할 때 success rate 대신 exploit 재현, regression, human review 기준을 함께 요구한다.
원문 열기arxiv-cs-cr · 2026-09-18 · research
ResumeShield: Channel Separation and an Open Benchmark for Indirect Prompt Injection in AI Resume Screening
요약: ResumeShield는 AI resume screening에서 indirect prompt injection을 막기 위해 channel separation과 open benchmark를 제안한다. 제목 자체가 resume screening, channel separation, open benchmark, indirect prompt injection을 명확히 담고 있다.
읽는 법: 사내 문서 처리 agent에 대해 untrusted document channel과 trusted instruction channel을 분리하는 test fixture를 만든다.
원문 열기arxiv-cs-cr · 2026-09-18 · research
Inference-Engine Fingerprinting Attacks are Practical: Exploring Model-Driven Environmental Discovery, Exploitation, and Escape
요약: Inference-Engine Fingerprinting Attacks are Practical은 모델이 환경을 발견하고 exploitation/escape로 이어질 수 있는 inference-engine fingerprinting을 다룬다. 제목은 environmental discovery, exploitation, escape 가능성을 직접 제기한다.
읽는 법: inference service에서 engine/version 노출, error text, timing side channel, sandbox escape 가능성을 점검한다.
원문 열기arxiv-cs-cr · 2026-09-16 · research
ROSETTA: Efficient and Accurate Privacy-Preserving LLM Decoding via Hybrid CKKS/TFHE Evaluation
요약: ROSETTA는 hybrid CKKS/TFHE evaluation으로 privacy-preserving LLM decoding을 효율적이고 정확하게 하려는 arXiv 연구다. 제목과 abstract는 homomorphic evaluation, decoding, accuracy/efficiency trade-off를 전면에 둔다.
읽는 법: private inference 요구가 있는 서비스라면 baseline으로만 저장하고, code나 benchmark artifact가 나오기 전까지 제품 적용은 보류한다.
원문 열기다음에 볼 것
- RAG/vector DB/retrieval pipeline에서 freshness, recall, context precision, citation traceability를 어떻게 평가할지 확인
- LangGraph/LangChain/MCP 기반 workflow에서 state transition과 tool boundary를 어떻게 평가할지 확인
- agent/RAG benchmark는 실제 서비스 task, regression trace, security/secret leakage 기준으로 나눠 추적
- 본문 근거가 부족한 출처는 원문과 공식 문서로 다시 확인
확인 필요
- 일부 출처는 짧은 요약만 확보되어 있으므로 깊은 기술 판단 전 원문 확인 필요
- 커뮤니티 출처는 초기 신호로만 사용하고 공식 출처로 교차 검증 필요
