분석 기간: 2026-07-20 ~ 2026-07-26 · 독자용 상세 리포트
[AIW] 7/26 이번 주의 핵심 이동은 모델 발표보다 에이전트 운영 하네스와 비용 검증으로 옮겨갔다는 점입니다.
요구사항 우선 렌즈
최신 사용자 요구사항을 우선 적용했습니다: Python/LLM 서비스 개발자가 1~4주 안에 실험할 수 있는 SDK/runtime/eval/RAG/tooling · MCP/tool calling/workflow automation/agent framework 변화 · RAG/vector DB/inference/runtime/observability/deployment 변화 · 주요 provider 모델/API/pricing/rate limit/SDK/platform 변경
오늘의 핫 뉴스
2026-07-26 기준 새로 눈에 띈 항목을 먼저 배치했습니다. 이후 섹션은 배경, 출처, 실행 항목 순서로 이어집니다.
#1 · Signal · 2026-07-26
Show HN: Boffin – Staff-engineer layer for AI coding agents
무슨 뉴스인가: Boffin은 AI 코딩 에이전트가 수정하려는 파일에 맞는 아키텍처 제약을 라우팅하고, 변경 규모에 비례한 검증을 요구하는 staff-engineer control layer입니다. Cursor, Claude Code, Codex, OpenCode를 지원하며 DuckDB, FastAPI, LangChain 사례에서 줄 수와 테스트 결과를 근거로 제시합니다.
왜 지금 보나: 활성 요구사항의 '에이전트가 더 많이 만들기보다 필요한 제약을 알고 작은 검증 가능한 diff를 내야 한다'는 개발 품질 렌즈에 정확히 맞습니다. 프롬프트팩이 아니라 per-edit 제약 라우팅과 사후 검증을 주장한다는 점이 실험 가치입니다.
원문 보기원문 링크: https://github.com/MicSm/boffin
#2 · Signal · 2026-07-26
Show HN: Cuts Long Horizon Inference Costs by 50% via external KV Cache Offload
무슨 뉴스인가: OpenLake는 LLM inference/training용 고성능 저장 엔진으로, vLLM용 KV Cache Offload connector를 제공합니다. README는 GPU host에 co-located petabyte-scale KV cache store를 두고, 128K context window에서 cached first token의 TTFT가 66배 빨라졌다고 주장합니다.
왜 지금 보나: OpenLake가 주장하는 절감 포인트는 추상적인 비용 최적화가 아니라 vLLM이 한 번 쓴 KV를 host RAM/disk 또는 GPU fleet의 공유 pool에서 다시 읽어 long/repeated prompt prefill을 줄이는 구조입니다. 같은 README에 OpenLakeConnector 설정, local/RDMA device 구성, Gemma4-31B on H100 256K context 데모가 함께 있어 LLM serving의 TTFT와 GPU seconds 계측 항목으로 바로 바꿀 수 있습니다.
원문 보기원문 링크: https://github.com/openlake-project/openlake
#3 · Signal · 2026-07-26
Show HN: Distill and serve models with frontier quality for half the cost
무슨 뉴스인가: World Model Optimizer는 이미 수집한 agent traces를 사용해 라우팅 정책, harness, 모델 distillation을 계속 최적화하는 CLI/플랫폼입니다. README는 OTel traces로 모델별 held-out task 점수를 만들고, knn routing policy를 fit한 뒤 `wmo serve`로 endpoint를 제공하며 40%+ lower cost를 목표로 한다고 설명합니다.
왜 지금 보나: 에이전트 운영 최적화가 prompt 수정에서 trace 기반 라우팅·simulation·distillation·E2B sandbox 평가로 넓어지고 있습니다. 실제 trace가 있는 팀이라면 비용 절감과 품질 유지의 재현 가능성을 실험할 가치가 있습니다.
원문 보기원문 링크: https://github.com/experientiallabs/world-model-optimizer
핵심 메시지
이번 주의 핵심 이동은 모델 발표보다 에이전트 운영 하네스와 비용 검증으로 옮겨갔다는 점입니다.
2026-07-20 ~ 2026-07-26 증거에서는 오픈소스/도구 신호가 전주보다 늘었고, 에이전트 평가·런타임 비용·보안/거버넌스 항목도 함께 증가했습니다. LangChain의 Deep Agents 평가 방식, Anthropic Opus 5의 장기 에이전트/코딩 벤치마크, OpenLake의 vLLM KV 캐시 오프로딩, Boffin과 telepty 같은 에이전트 작업 제어 도구가 같은 방향을 가리킵니다. 다만 GitHub/HN 경유 도구는 채택 신호일 뿐 성능이나 안정성을 증명하지 않으므로, 공식/원문 근거가 있는 항목만 실행 후보로 올리는 것이 맞습니다.
전일자 기준 핵심
전일자 기준 핵심 · 2026-07-26 · geeknews · novelty=new
Show GN: telepty — 여러 머신에 흩어진 AI 에이전트 세션 컨트롤 플레인
무슨 뉴스인가: telepty는 여러 머신에서 돌아가는 Claude, Codex, Gemini 같은 터미널 AI CLI 세션에 이름 기반 주소를 붙이고 원격 지시, 화면 읽기, broadcast를 제공하는 경량 세션 컨트롤 플레인입니다. PTY 기반 백그라운드 데몬과 세션 브리지를 두고, 전송 계층은 Tailscale/WireGuard나 SSH 터널에 맡긴다고 설명합니다.
무엇이 중요한가: 에이전트 작업이 여러 머신과 여러 CLI 세션으로 나뉠 때 사람이 터미널을 오가며 지시와 결과를 운반하는 병목을 줄일 수 있습니다. 다만 보안과 신뢰는 Tailscale/SSH 및 세션 권한 설계에 기대므로 실제 도입 전에는 권한 경계와 로그를 먼저 봐야 합니다.
오늘 볼 포인트: 이름@호스트 주소화, inject/read-screen/broadcast 명령, Tailscale 위임, macOS·Linux·Windows 지원, CLI용 skill 9종 포함 여부를 확인하세요.
다음 행동: 개인 실험 환경에서만 한두 세션을 연결해 지시 접수 확인, 화면 회수, 실패 시 로그와 재전송 동작을 먼저 테스트하세요.
장기 맥락: extends
출처 신호: GeekNews 커뮤니티 큐레이션 신호
전일자 핵심 원문 보기원문 링크: https://news.hada.io/topic?id=31842
반복 관찰된 흐름
에이전트 평가/운영 품질 반복 신호
반복되는 흐름은 에이전트를 더 강한 모델로만 해결하려는 방향이 아니라, 환경이 포함된 평가셋, 실행 추적, 비용/latency 측정, 권한 경계, 실패 복구 절차로 운영 품질을 재정의하는 방향입니다. LangChain은 Harbor 기반 end-to-end eval을, Anthropic은 Opus 5의 장기 코딩·업무 벤치마크와 API fallback을, QuantiBias와 WorkBuddy Bench는 모델 압축/코딩 에이전트 평가의 blind spot을 각각 보여줍니다.
지난 발송 대비: 새로운 독립 결론은 '에이전트 평가와 비용 최적화가 동시에 제품화되고 있다'는 점입니다. 단순 관심 반복이 아니라 OpenLake의 vLLM KV 오프로딩, WMO의 trace 기반 라우팅, claude-thermos의 prompt cache warming처럼 운영비를 직접 줄이려는 구현이 이번 창에서 눈에 띄게 늘었습니다.
장기 흐름: 이번 메일의 주요 항목은 주간/월간 누적 트렌드 메모에도 반영되어, 반복·강화·비판 신호를 다음 리포트에서 이어서 볼 수 있습니다.
읽는 법: 이번 주에는 내부 에이전트 체크리스트에 평가 환경, tool/schema 권한, cache/latency 비용 계측, rollback·재개 기준 중 빠진 항목 하나를 골라 실제 회귀 테스트나 작은 벤치로 옮기세요.
묶어서 볼 출처
- Introducing Claude Opus 5 Product Jul 24, 2026 Opus 5 is a step change improvement for the Opus tier powering long-ru...
- Are AI Labs Pelicanmaxxing? · hnrss-frontpage
- QuantiBias: Benchmarking Quantization-Induced Bias in LLMs · arxiv-cs-cl
- Jack Dorsey launches Buzz to combine team chat, AI agents and Git hosting · hnrss-frontpage
- Show HN: Claude-thermos keeps your Claude session warm for you · hnrss-ai
- Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction · arxiv...
- Frontier Financial Judgement: Can agents tell what might move a stock? · arxiv-cs-cl
반복 항목은 개별 카드로 재노출하지 않고, 변화가 있는지와 어떤 체크리스트로 바꿀지만 압축했습니다.
30초 요약
이번 메일은 Show HN: Boffin – Staff-engineer layer for AI coding agents, Show HN: Cuts Long Horizon Inference Costs by 50% via external KV Cache Offload를 중심으로 최신 수집 신호를 읽습니다.
근거 출처는 geeknews, hnrss-newest-broad, hnrss-show 등이며, 각 항목은 적용 조건과 확인할 리스크를 분리해 봅니다.
출처 범위: 기업/공식 발표 · 오픈소스/개발자 도구 · 커뮤니티 반응
핫 오픈소스/도구 레이더
왜 핫한가: 도구 관점에서 묶어 보면 Show HN: Distill and serve models with frontier quality for half the cost 같은 항목은 작은 릴리스나 커뮤니티 링크가 아니라 로컬 실행, 개발 워크플로, 실험 자동화의 실제 마찰을 줄이는 후보군입니다. World Model Optimizer는 이미 수집한 agent traces를 사용해 라우팅 정책, harness, 모델 distillation을 계속 최적화하는 CLI/플랫폼입니다. README는 OTel traces로 모델별 held-out task 점수를 만들고, knn routing policy를 fit한 뒤 `wmo serve`로 endpoint를 제공하며 40%+ lower cost를 목표로 한다고 설명합니다.
먼저 볼 것: Show HN: Distill and serve models with frontier quality for half the cost에서는 tool schema, 권한 경계, timeout/retry, 실패 로그를 먼저 확인하세요. 성공 데모보다 실패했을 때 어디서 멈추고 어떻게 복구하는지가 운영 품질을 가릅니다.
출처별 핵심 소식
요약: 공식 발표, 오픈소스/도구, 커뮤니티 신호를 분리해 읽도록 압축했습니다.
읽는 법: 메일 상단의 핫 뉴스와 도구 레이더를 먼저 보고, 첨부 상세 리포트에서 원문 근거와 한계를 확인하세요.
다음 행동
- Deep Agents, WorkBuddy Bench, QuantiBias를 내부 golden set과 실패 taxonomy 후보로 읽고, 답변 점수보다 환경·도구·검사를 확인한다.
- OpenLake와 WMO는 비용 절감 주장만 보지 말고 현재 vLLM/trace/OTel 데이터로 작은 재현 실험을 만든다.
더 자세한 근거와 전체 기사 목록은 첨부된 상세 리포트에서 확인할 수 있습니다.
새로 잡힌 watch 후보
장기 지식으로 확정하기엔 이르지만, 최근성 때문에 확인할 만한 신규 수집 신호입니다.
소개 · hnrss-frontpage · 2026-07-26
The relay market powering token resellers and fraud
이 글 요약: Vectoral 글은 token relay market이 account pool, relay/transfer station, end user 계층으로 API 접근을 재판매하는 구조를 설명합니다. 예시로 공식 Anthropic credit 3,333달러 상당을 425 RMB에 파는 패키지, 최고 97.8% 할인, top 10 relay의 월 360만 방문을 제시합니다.
왜 볼 만한가: free-trial abuse, chargeback, prepaid card, open inference, denial-of-wallet 방식을 내부 계정 생성/결제/사용량 모니터링 체크리스트와 대조하세요.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기원문 링크: https://vectoral.com/blog/token-relay-market
소개 · hnrss-newest-broad · 2026-07-26
Show HN: HART OS – an open-source AI OS built so frontier AI needs no datacenter
이 글 요약: HART OS는 로컬 하드웨어에서 모델을 돌리고 OpenAI 호환 API를 제공하는 AI-native OS/런타임을 표방합니다. README는 8GB RAM에서는 CPU fallback과 0.8B~4B급 작은 모델, 로컬 7B에는 16GB와 GPU, speculative decoding에는 약 10GB VRAM이 필요하다고 경계를 둡니다.
왜 볼 만한가: OpenAI protocol endpoint :6777, llama.cpp/GGUF 경로, Python 3.10/3.11 요구, 192개 pinned package 설치 부담, private native loader seam을 확인하세요.
주의: Show HN: HART OS – an open-source AI OS built so frontier AI needs no 관련 커뮤니티 신호이므로 공식/1차 출처 확인 전에는 사실로 단정하지 마세요.; Show HN: HART OS – an open-source AI OS built so frontier AI needs no는 원문 페이지 잡음을 제거한 뒤 남은 단서로 요약했으므로 실제 변경점과 반론을 원문에서 다시 확인하세요.
원문 보기원문 링크: https://github.com/hertz-ai/HARTOS
소개 · hnrss-newest-broad · 2026-07-26
Cursor Bridge – Run Unlimited Claude Code on Your Cursor Subscription
이 글 요약: cursor-bridge는 Claude Code CLI를 Cursor subscription의 backend로 실행하게 하는 Rust 단일 바이너리입니다. 로컬 HTTP proxy를 랜덤 포트에 띄우고 Cursor auth token을 macOS keychain 또는 Linux CURSOR_TOKEN에서 읽어 Anthropic API 호출을 Cursor agent CLI로 변환한다고 설명합니다.
왜 볼 만한가: macOS/Linux 지원, Cursor agent CLI 인증, Claude Code CLI 필요, proxy lifecycle, no workspace sandboxing, 법적 비제휴 문구를 확인하세요.
주의: Cursor Bridge – Run Unlimited Claude Code on Your Cursor Subscription 관련 커뮤니티 신호이므로 공식/1차 출처 확인 전에는 사실로 단정하지 마세요.; Cursor Bridge – Run Unlimited Claude Code on Your Cursor Subscription는 원문 페이지 잡음을 제거한 뒤 남은 단서로 요약했으므로 실제 변경점과 반론을 원문에서 다시 확인하세요.
원문 보기원문 링크: https://github.com/hkc5/cursor-bridge
승격 후보 · youtube-ibm-technology-official · 2026-07-26
Why AI Makes the Humanities More Important Than Ever
이 글 요약: IBM Technology 영상은 AI가 요약, 질의응답, 연구, 코드 작성, 음악 생성 같은 출력을 만들 수 있지만 무엇을 물어야 하고 어떤 가치 판단을 해야 하는지는 별도 역량이라고 주장합니다. 설명은 Human Centered AI, 윤리, 해석, 비판적 사고를 책임 있는 AI 사용의 핵심으로 둡니다.
왜 볼 만한가: 기능 출시 뉴스로 읽지 말고, 내부 에이전트 리뷰 체크리스트에 질문 품질, 목적 적합성, 윤리/사용자 영향 검토가 들어있는지 점검하세요.
주의: 스폰서/프로모션성 문구가 섞여 있어 신호 강도를 낮게 봐야 합니다.
원문 보기원문 링크: https://www.youtube.com/watch?v=l-QPwk_f4eE
소개 · arxiv-cs-cl · 2026-07-25
Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
이 글 요약: 이 논문은 5개 LLM이 다중 센서 physical hazard 데이터를 어떻게 판단하는지 60개 scenario, 3개 category, 1,800 API calls, temperature 0.0 조건으로 평가했습니다. 모든 테스트 모델은 개별 안전한도 아래에서 여러 센서가 동시에 상승한 Category A에서는 거의 경고를 내지 못했고, 단일 센서 한계 초과에서는 거의 완벽했습니다.
왜 볼 만한가: ChatGPT-4o, Gemini 2.5 Flash, DeepSeek, Kimi, Llama 3.1 8B, Category A Q2/Q3 near-zero, Category B Q1 0.975~1.000, prose vs tabular 결과를 확인하세요.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기원문 링크: https://arxiv.org/abs/2607.20476
한눈에 보는 판세
한눈에 보는 판세
2026-07-20 ~ 2026-07-26 증거에서는 오픈소스/도구 신호가 전주보다 늘었고, 에이전트 평가·런타임 비용·보안/거버넌스 항목도 함께 증가했습니다. LangChain의 Deep Agents 평가 방식, Anthropic Opus 5의 장기 에이전트/코딩 벤치마크, OpenLake의 vLLM KV 캐시 오프로딩, Boffin과 telepty 같은 에이전트 작업 제어 도구가 같은 방향을 가리킵니다. 다만 GitHub/HN 경유 도구는 채택 신호일 뿐 성능이나 안정성을 증명하지 않으므로, 공식/원문 근거가 있는 항목만 실행 후보로 올리는 것이 맞습니다.
무엇이 달라졌나
- 주요 반복 흐름: Open Source Models/Tooling, Agentic AI, AI Infrastructure
- 핵심 해석: RAG/Data Quality, Agentic AI, Evaluation
- 커뮤니티 인기 신호와 공식/기술 근거를 분리해, 관심도와 사실성을 별도로 읽도록 구성했습니다.
왜 중요한가
- RAG와 agent는 별개 기능이 아니라 같은 품질 체계 안에서 평가해야 합니다.
- 오픈소스 릴리스는 바로 도입보다 breaking change, migration note, benchmark 유무를 먼저 봐야 합니다.
- HN/GeekNews/Lobsters의 인기 글은 시장 관심을 보여주지만, 제품 판단 근거로 쓰기 전 교차 확인이 필요합니다.
커뮤니티 관심 신호
- Show GN: telepty — 여러 머신에 흩어진 AI 에이전트 세션 컨트롤 플레인 (geeknews, GeekNews 최신 큐레이션 신호; RSS에는 추천/댓글 수가 포함되지 않음): 오픈소스 도구 신호입니다. 실제 agent workflow나 inference stack에 붙일 수 있는지 검토하세요.
- A tour of MLIR: The Dialect Stack Everyone Depends On (lobsters-ai, Lobsters engineering discussion 신호; RSS에는 점수/댓글 수가 제한적으로만 포함됨): AI 앱/RAG/agent 엔지니어링 관점에서 retrieval, tool boundary, state, 품질 지표와 연결되는지 확인할 후보입니다.
다음 행동
- Deep Agents, WorkBuddy Bench, QuantiBias를 내부 golden set과 실패 taxonomy 후보로 읽고, 답변 점수보다 환경·도구·검사 스크립트·반복 실행을 먼저 점검한다.
- OpenLake와 WMO는 비용 절감 주장만 보지 말고 현재 vLLM/trace/OTel 데이터로 작은 재현 실험을 만든다.
- Boffin, telepty, Buzz는 에이전트 협업 도구로 보되 권한 경계, 로그, 실패 복구, 사람이 설명 가능한 diff 기준을 먼저 비교한다.
- 반복 등장하는 주제는 다음 리포트에서도 이어서 추적하고, 실제 적용 사례와 평가 기준을 비교하세요.
전주 대비 흐름
비교 기간: 2026-07-13 ~ 2026-07-19 → 2026-07-20 ~ 2026-07-26
2026-07-20 ~ 2026-07-26에는 오픈소스/도구 신호가 2026-07-13 ~ 2026-07-19보다 늘었습니다.
해석: 2026-07-13 ~ 2026-07-19에는 모델/API 릴리스, 오픈소스/도구, 커뮤니티 관심, 연구/논문 쪽이 많이 보였고, 2026-07-20 ~ 2026-07-26에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽으로 관심이 옮겨갔습니다. 증가 신호는 RAG/검색/데이터, 평가와 품질 관리, 기업/공식 발표, 오픈소스/도구입니다.
해석 신뢰도: medium
주제 축 변화
- RAG/검색/데이터: 2026-07-20 ~ 2026-07-26 305건 / 2026-07-13 ~ 2026-07-19 247건 / 증가 (+58)
- 평가와 품질 관리: 2026-07-20 ~ 2026-07-26 296건 / 2026-07-13 ~ 2026-07-19 211건 / 증가 (+85)
- 에이전트와 도구 호출: 2026-07-20 ~ 2026-07-26 379건 / 2026-07-13 ~ 2026-07-19 353건 / 증가 (+26)
- 서빙/런타임/운영: 2026-07-20 ~ 2026-07-26 194건 / 2026-07-13 ~ 2026-07-19 133건 / 증가 (+61)
- 보안/거버넌스: 2026-07-20 ~ 2026-07-26 277건 / 2026-07-13 ~ 2026-07-19 204건 / 증가 (+73)
출처 유형 변화
- 기업/공식 발표: 2026-07-20 ~ 2026-07-26 23건 / 2026-07-13 ~ 2026-07-19 22건 / 증가 (+1)
- 오픈소스: 2026-07-20 ~ 2026-07-26 236건 / 2026-07-13 ~ 2026-07-19 171건 / 증가 (+65)
- 커뮤니티 관심: 2026-07-20 ~ 2026-07-26 516건 / 2026-07-13 ~ 2026-07-19 633건 / 감소 (-117)
- 연구/논문: 2026-07-20 ~ 2026-07-26 901건 / 2026-07-13 ~ 2026-07-19 553건 / 증가 (+348)
- 기타: 2026-07-20 ~ 2026-07-26 188건 / 2026-07-13 ~ 2026-07-19 169건 / 증가 (+19)
핫 오픈소스/도구 레이더
hnrss-ai · 2026-07-23
Show HN: Claude-thermos keeps your Claude session warm for you
요약: claude-thermos는 Claude Code 세션의 prompt cache가 subagent 대기 중 만료되는 비용 문제를 줄이기 위해 warm request를 보내는 로컬 reverse proxy입니다. README는 5분 TTL, cache read 0.1x, write 1.25x, 185개 local session에서 rebuild가 총 비용의 약 22%였다는 관측을 설명합니다.
읽는 법: 개인 Claude Code 실험에서만 소규모로 켜고 summary.json의 rewrite_avoided_tokens와 warm_cost가 실제 세션에서 맞는지 확인하세요.
원문 열기원문 링크: https://github.com/izeigerman/claude-thermos
hnrss-frontpage · 2026-07-21
Jack Dorsey launches Buzz to combine team chat, AI agents and Git hosting
요약: Buzz는 Block이 공개한 self-hostable workspace로, 팀 채팅, AI agents, Git hosting, workflow events를 Nostr relay와 cryptographically signed events 위에 통합하려는 제품입니다. 문서상 agents는 과거 논의 검색, repo 열기, patch 제출, code review, workflow 실행, canvas 편집, channel 생성까지 할 수 있습니다.
읽는 법: 도입보다 아키텍처 비교 대상으로 읽고, agent identity와 audit trail을 내부 협업 도구 요구사항으로 분리하세요.
원문 열기원문 링크: https://runtimewire.com/article/jack-dorsey-block-buzz-team-chat-ai-agents-git
커뮤니티 관심 신호
hnrss-frontpage · 2026-07-22
Are AI Labs Pelicanmaxxing?
요약: 이 글은 주요 모델 7개에 대해 8개 동물과 6개 탈것 조합, 총 48개 프롬프트로 1,008개의 SVG를 생성하고 특정 유명 프롬프트에 과최적화됐는지 실험했습니다. 저자는 pelican/bicycle/cell 효과를 difficulty-adjusted regression으로 봤고, 특정 조합의 유의한 boost는 찾지 못했다고 결론냅니다.
읽는 법: 내부 데모 프롬프트가 있다면 주변 변형 prompt grid를 만들어 과최적화 신호가 있는지 작은 실험으로 확인하세요.
원문 열기원문 링크: https://dylancastillo.co/posts/pelicanmaxxing.html
주요 기사
langchain-blog · 2026-07-23 · official
How We Benchmark Deep Agents
요약: LangChain은 Deep Agents 평가를 unit-style tests에서 Harbor 기반 end-to-end eval 중심으로 확장했다고 설명합니다. 각 task는 Dockerfile 또는 Docker Compose YAML 환경, Markdown instruction, test.sh 평가 스크립트로 구성되고 Harbor-Index 82 tasks, tau3-bench 30-task subset, ContextBench 30 calibrated tasks를 사용합니다.
읽는 법: 내부 에이전트 평가를 dataset, sandbox, instruction, test script로 나누고 빠른 lite subset과 full run을 분리하세요.
원문 열기원문 링크: https://www.langchain.com/blog/how-we-benchmark-deep-agents
anthropic-news · 2026-07-24 · official
Introducing Claude Opus 5 Product Jul 24, 2026 Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
요약: Anthropic은 Claude Opus 5를 2026-07-24 출시했고, Opus tier에서 long-running agents, coding, professional work를 개선했다고 발표했습니다. 가격은 Opus 4.8과 같은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러이며, API에서는 claude-opus-5로 사용할 수 있고 Fast mode는 약 2.5배 속도에 base price의 2배입니다.
읽는 법: 기존 Opus 4.8/other model golden set에 Opus 5를 추가하고, effort별 비용·latency·tool change/cache 영향·fallback 동작을 나눠 측정하세요.
원문 열기원문 링크: https://www.anthropic.com/news/claude-opus-5
arxiv-cs-cl · 2026-07-25 · research
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
요약: Tencent WorkBuddy Bench는 multi-domain coding-agent benchmark로, 제목부터 contamination-resistant task construction을 강조합니다. arXiv 원문은 Tencent WorkBuddy Bench Team의 2026-07-23 제출 논문으로, coding-agent 평가와 task contamination 방지 자체를 주제로 둡니다.
읽는 법: 논문 본문을 별도 검토해 내부 coding-agent eval에 적용 가능한 task construction 규칙만 추출하세요.
원문 열기원문 링크: https://arxiv.org/abs/2607.20911
arxiv-cs-cl · 2026-07-25 · research
QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
요약: QuantiBias는 quantized LLM이 표준 안전 평가를 통과해도 open-ended generation에서 bias가 증가할 수 있음을 평가하는 benchmark입니다. 논문은 Qwen과 Gemma 두 backbone, five-family screen, 8개 benchmark, 8개 언어를 사용했고 open-ended answer의 약 24~27%에서 independent judge가 stereotype을 본다고 주장합니다.
읽는 법: quantized 모델을 쓰는 서비스라면 기존 safety suite에 open-ended multilingual generation probe를 추가하세요.
원문 열기원문 링크: https://arxiv.org/abs/2607.21063
lobsters-ai · 2026-07-24 · community
A tour of MLIR: The Dialect Stack Everyone Depends On
요약: 이 글은 MLIR을 고정된 하나의 IR이 아니라 dialect를 만들고 섞는 IR construction kit로 설명합니다. XLA, Triton, Mojo, Torch-MLIR, IREE, ONNX-MLIR이 MLIR 계열에 기대며, linalg/tensor에서 memref, affine/scf, vector, llvm/gpu/nvvm/spirv로 점진적으로 lowering되는 과정을 보여줍니다.
읽는 법: 현재 사용하는 inference/training stack에서 XLA/Triton/IREE/Torch-MLIR 경로가 어디에 있는지 문서화하고, 성능 회귀 시 IR dump나 pass boundary를 볼 수 있는지 점검하세요.
원문 열기원문 링크: https://hiraditya.github.io/posts/mlir-dialect-stack-for-ml
arxiv-cs-cl · 2026-07-25 · research
Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment
요약: 이 논문은 5개 LLM이 다중 센서 physical hazard 데이터를 어떻게 판단하는지 60개 scenario, 3개 category, 1,800 API calls, temperature 0.0 조건으로 평가했습니다. 모든 테스트 모델은 개별 안전한도 아래에서 여러 센서가 동시에 상승한 Category A에서는 거의 경고를 내지 못했고, 단일 센서 한계 초과에서는 거의 완벽했습니다.
읽는 법: 운영 알림 에이전트가 있다면 단일 threshold뿐 아니라 여러 약한 신호가 동시에 움직이는 synthetic case를 추가하세요.
원문 열기원문 링크: https://arxiv.org/abs/2607.20476
arxiv-cs-cl · 2026-07-25 · research
Frontier Financial Judgement: Can agents tell what might move a stock?
요약: Frontier Financial Judgement는 professional equity analysts와 함께 만든 agent benchmark로, 새 정보가 주가에 영향을 줄지 판단하는 능력을 평가합니다. 656개 assessment item을 만들었고, 가장 강한 agent도 expert label 전체 일치율이 52.4%에 그쳤으며 false-positive rate는 GPT-5.6 Sol 약 1%부터 Claude Sonnet 4.6 약 32%까지 벌어졌다고 보고합니다.
읽는 법: 뉴스/문서 triage 에이전트가 있다면 false-positive cost를 별도 metric으로 두고 stale vs valuation-relevant 분류 케이스를 추가하세요.
원문 열기원문 링크: https://arxiv.org/abs/2607.20645
다음에 볼 것
- RAG/vector DB/retrieval pipeline에서 freshness, recall, context precision, citation traceability를 어떻게 평가할지 확인
- LangGraph/LangChain/MCP 기반 workflow에서 state transition과 tool boundary를 어떻게 평가할지 확인
- agent/RAG benchmark는 실제 서비스 task, regression trace, security/secret leakage 기준으로 나눠 추적
- 본문이 얇게 수집된 출처는 selector 개선 후 재수집하고 공식 문서로 교차 확인
확인 필요
- 일부 raw Markdown은 feed excerpt 수준이므로 깊은 기술 판단 전 원문 확인 필요
- 커뮤니티 출처는 초기 신호로만 사용하고 공식 출처로 교차 검증 필요
