분석 기간: 2026-07-19 ~ 2026-07-25 · 독자용 상세 리포트
[AIW] 7/25 에이전트 경쟁의 초점이 모델 호출에서 평가, 컨텍스트, 운영 소유권으로 이동했다
요구사항 우선 렌즈
최신 사용자 요구사항을 우선 적용했습니다: Python/LLM 서비스 개발자가 1~4주 안에 실험할 수 있는 SDK/runtime/eval/RAG/tooling · MCP/tool calling/workflow automation/agent framework 변화 · RAG/vector DB/inference/runtime/observability/deployment 변화 · 주요 provider 모델/API/pricing/rate limit/SDK/platform 변경
오늘의 핫 뉴스
2026-07-25 기준 새로 눈에 띈 항목을 먼저 배치했습니다. 이후 섹션은 배경, 출처, 실행 항목 순서로 이어집니다.
#1 · Signal · 2026-07-25
What does it mean to "own your intelligence"?
무슨 뉴스인가: LangChain의 글은 기업이 모든 AI stack을 직접 만들 필요는 없지만 model, agent system, context, memory, cost, quality, risk, behavior를 통제해야 intelligence를 소유한다고 주장한다. 특히 harness, context, memory, traces, feedback, evals가 시간이 갈수록 개선되는 loop를 만든다고 정리한다.
왜 지금 보나: agent 서비스를 제품화하는 팀은 provider API만 고르는 단계에서 벗어나야 한다. 모델 교체 가능성, orchestration logic, per-user cost control, full trace, eval regression, memory portability를 운영 체크리스트로 갖추는지가 경쟁력이 된다.
원문 보기원문 링크: https://www.langchain.com/blog/own-your-intelligence
#2 · Tool · 2026-07-25
The new rules of context engineering for Claude 5 generation models
무슨 뉴스인가: Claude 5 context engineering 글은 Claude Code의 system prompt를 80% 이상 줄였고, 더 강한 모델에는 짧고 명확한 prompt와 tool, context 설계가 낫다는 방향을 제시한다. source body에는 Agents, Product, Enterprise, Platform 맥락과 Claude Code 관련 context engineering 변경이 함께 나온다.
왜 지금 보나: 이는 에이전트 성능 개선을 prompt 길이와 규칙 추가로만 해결하려는 접근에 대한 반례다. 강한 모델로 갈수록 컨텍스트를 많이 주는 것보다 필요한 도구, 파일, instructions를 선별하고 불필요한 규칙을 제거하는 품질 기준이 중요해진다.
원문 보기원문 링크: https://claude.com/blog/the-new-rules-of-context-engineering-for-claude-5-generation-models
핵심 메시지
에이전트 경쟁의 초점이 모델 호출에서 평가, 컨텍스트, 운영 소유권으로 이동했다
2026-07-19부터 2026-07-25까지의 근거는 새 모델 발표보다 에이전트를 어떻게 평가하고 운영할지가 더 중요한 축으로 이동했음을 보여준다. WorkBuddy Bench와 PersonaTrail은 실제 업무, browsing history, memory를 평가 대상으로 끌어올렸고, QuantiBias와 물리 위험 평가는 비용 최적화나 단일 threshold 평가가 놓치는 안전 문제를 드러냈다. LangChain과 Claude context engineering 자료는 harness, context, memory, trace, eval을 팀이 소유해야 한다는 운영 기준을 강화한다.
전일자 기준 핵심
전일자 기준 핵심 · 2026-07-25 · arxiv-cs-cl · novelty=new
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resista...
무슨 뉴스인가: Tencent WorkBuddy Bench는 코딩 에이전트를 Code, Web, Office, Security 네 업무 영역에서 평가하는 공개 벤치마크다. 과제는 공개 이슈 문구를 베끼지 않고 실제 commit, pull request, business scenario에서 역설계해 짧은 역할극 요청으로 다시 만든다.
무엇이 중요한가: 에이전트 평가는 단순 코딩 문제를 넘어 업무 흐름과 보안 작업까지 확장되고 있다. task directories, environment images, evaluation harness, tests, reference solutions를 공개해 재현성을 높였지만 subset별 점수는 서로 비교하지 말라고 제한한다.
오늘 볼 포인트: 내 서비스의 에이전트 평가도 프롬프트 정답률보다 업무 도메인별 실패 유형, 환경 이미지, 테스트 하네스, 기준 해답을 함께 묶어야 한다.
다음 행동: 현재 회귀 테스트에 repository-level engineering, front-end, office workflow, security task가 분리되어 있는지 확인하고 부족한 영역을 golden set으로 추가한다.
출처 신호: technical/research source or tier 2 source
전일자 핵심 원문 보기원문 링크: https://arxiv.org/abs/2607.20911
반복 관찰된 흐름
에이전트 평가/운영 품질 반복 신호
이번 주 반복되는 흐름은 agent 기능 자체보다 평가 하네스, context와 memory 소유권, trace 기반 품질 관리가 중요해졌다는 점이다.
지난 발송 대비: 새로운 변화는 WorkBuddy Bench와 PersonaTrail처럼 실제 업무와 개인화 history를 평가 대상으로 삼는 벤치마크가 늘었고, Claude와 LangChain 쪽 자료가 prompt 양보다 harness와 eval ownership을 더 강조한다는 점이다.
장기 흐름: 이번 메일의 주요 항목은 주간/월간 누적 트렌드 메모에도 반영되어, 반복·강화·비판 신호를 다음 리포트에서 이어서 볼 수 있습니다.
읽는 법: 다음 주에는 agent 기능 추가보다 현재 서비스의 golden trace, failure taxonomy, model swap eval, memory portability 체크리스트를 먼저 업데이트한다.
묶어서 볼 출처
- Are AI Labs Pelicanmaxxing? · hnrss-frontpage
- Jack Dorsey launches Buzz to combine team chat, AI agents and Git hosting · hnrss-frontpage
- Show GN: 제약 최적화로 코딩 에이전트의 작업을 구조화하는 오픈소스 스킬 · geeknews
- Show HN: Claude-thermos keeps your Claude session warm for you · hnrss-ai
- A tour of MLIR: The Dialect Stack Everyone Depends On · lobsters-ai
반복 항목은 개별 카드로 재노출하지 않고, 변화가 있는지와 어떤 체크리스트로 바꿀지만 압축했습니다.
30초 요약
이번 메일은 How We Benchmark Deep Agents, What does it mean to "own your intelligence"?를 중심으로 최신 수집 신호를 읽습니다.
근거 출처는 anthropic-news, arxiv-cs-cl, hnrss-frontpage 등이며, 각 항목은 적용 조건과 확인할 리스크를 분리해 봅니다.
출처 범위: 기업/공식 발표 · 오픈소스/개발자 도구 · 커뮤니티 반응
출처별 핵심 소식
요약: 공식 발표, 오픈소스/도구, 커뮤니티 신호를 분리해 읽도록 압축했습니다.
읽는 법: 메일 상단의 핫 뉴스와 도구 레이더를 먼저 보고, 첨부 상세 리포트에서 원문 근거와 한계를 확인하세요.
다음 행동
- 코딩 에이전트 평가는 단일 문제 풀이 대신 업무 도메인별 task directory, environment image, test harness, reference solution을를 확인한다.
- agent memory와 RAG 품질은 factual memory, preference memory, browsing trail, failure taxonomy로 분리해 측정한다.
더 자세한 근거와 전체 기사 목록은 첨부된 상세 리포트에서 확인할 수 있습니다.
먼저 읽을 관련 출처
링크를 전부 나열하지 않고, 이번 메일의 판단을 이해하는 데 도움이 되는 순서로 골랐습니다.
P0 · 오픈소스/도구 · arxiv-cs-cl · 2026-07-25
QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
설명: QuantiBias는 양자화된 LLM이 표준 안전 평가에서는 문제가 없어 보여도 open-ended 질문에서 bias가 늘어나는지 측정한 벤치마크다. 논문은 harmful request refusal, benign prompt over-refusal, multiple-choice answer는 유지되지만, eight languages의 open-ended answers 중 independent judge 기준 약 24%에서 stereotypes가 나왔다고 설명한다.
읽을 포인트: 서비스 비용을 줄이려고 quantized model을 쓰는 팀은 latency와 비용만 보면 안 된다. 같은 모델, training, prompt를 고정해도 출력 형식이 open-ended로 바뀌면 multilingual bias가 드러날 수 있어 배포 전 평가 축을 바꿔야 한다.
임팩트: 현재 inference 비용 절감 실험에 eight-language open-ended prompt와 independent judge 기준을 추가한다.
출처 신호: technical/research source or tier 2 source
원문 보기원문 링크: https://arxiv.org/abs/2607.21063
새로 잡힌 watch 후보
장기 지식으로 확정하기엔 이르지만, 최근성 때문에 확인할 만한 신규 수집 신호입니다.
승격 후보 · youtube-databricks-official · 2026-07-25
Build an AI Data Analyst in Minutes with Databricks Genie Agent
이 글 요약: Databricks 영상은 Genie Agent로 데이터 분석 에이전트를 만드는 흐름을 보여준다. transcript에는 data sources로 테이블을 추가하고 instructions를 쓰며, ground-truth SQL과 15개 benchmarks를 이용해 실패한 benchmark를 표시하는 과정이 나온다.
왜 볼 만한가: 데이터 분석 agent를 붙일 때는 데모 성공 장면보다 ground-truth SQL, 실패 benchmark, 사용 가능한 테이블 범위를 먼저 검토한다.
주의: 스폰서/프로모션성 문구가 섞여 있어 신호 강도를 낮게 봐야 합니다.
원문 보기원문 링크: https://www.youtube.com/shorts/7eSOvPsSjgU
소개 · arxiv-cs-cl · 2026-07-25
PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails
이 글 요약: PersonaTrail은 개인화 웹 에이전트가 사용자의 raw browsing histories에서 빠진 맥락을 추론하는지 평가하는 벤치마크다. 논문은 realistic browsing trajectories를 사용자 기록으로 쓰고, PACMem이 factual memories와 preference memories를 나눠 개인화 navigation에 활용한다고 설명한다.
왜 볼 만한가: agent memory를 만들 때 개인 히스토리를 통째로 넣기보다 factual memory와 preference memory를 나눠 테스트하는 기준을 검토한다.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기원문 링크: https://arxiv.org/abs/2607.20482
승격 후보 · youtube-nvidia-developer-official · 2026-07-25
"There's probably a model for that."
이 글 요약: NVIDIA Developer Shorts는 다양한 모델 선택을 암시하는 짧은 영상이며 transcript와 메타데이터에는 NVIDIA Developer, YouTube transcript, topic signals로 agent, infra, model-release, multimodal이 기록되어 있다. 다만 본문 길이가 짧아 실제 제품명, API 범위, 지원 조건을 설명하기에는 제한적이다.
왜 볼 만한가: 영상 제목보다 transcript와 연결 문서에서 실제 모델명, 배포 조건, guardrail 지원 범위가 있는지 확인한다.
원문 보기원문 링크: https://www.youtube.com/shorts/sVvS--u24GM
소개 · arxiv-cs-cl · 2026-07-25
Frontier Financial Judgement: Can agents tell what might move a stock?
이 글 요약: Frontier Financial Judgement는 전문 equity analyst와 함께 만든 금융 판단 벤치마크다. 논문은 656개 뉴스 항목을 평가했고, 가장 강한 agent도 expert label 전체 일치가 52.4%에 그쳤으며 false-positive rate 추정이 약 1%에서 32%까지 갈렸다고 밝힌다.
왜 볼 만한가: 뉴스 triage나 리스크 감지 agent를 만들 때 true positive만 보지 말고 false positive budget과 review queue 크기를 먼저 정한다.
주의: 보조 신호이므로 장기 지식이나 운영 판단으로 쓰기 전 원문과 1차 근거 확인이 필요합니다.
원문 보기원문 링크: https://arxiv.org/abs/2607.20645
소개 · hnrss-newest-broad · 2026-07-25
Turn And Face The Strange
이 글 요약: Fly.io의 글은 frontier agent coding harness를 안전하게 실행하는 회사 맥락에서 fixed-function applications와 fussy CI/CD rails를 언급한다. 본문은 AI agent를 제품 운영과 배포 레일에 연결하는 관점을 제공하지만 직접적인 LLM API 변경은 아니다.
왜 볼 만한가: agent coding harness를 운영할 때 배포 레일과 승인 기준이 없는 자동화를 허용하고 있는지 점검한다.
주의: Turn And Face The Strange 관련 커뮤니티 신호이므로 공식/1차 출처 확인 전에는 사실로 단정하지 마세요.; Turn And Face The Strange는 원문 페이지 잡음을 제거한 뒤 남은 단서로 요약했으므로 실제 변경점과 반론을 원문에서 다시 확인하세요.
원문 보기원문 링크: https://fly.io/blog/kurt-scott-money-sprites
한눈에 보는 판세
한눈에 보는 판세
2026-07-19부터 2026-07-25까지의 근거는 새 모델 발표보다 에이전트를 어떻게 평가하고 운영할지가 더 중요한 축으로 이동했음을 보여준다. WorkBuddy Bench와 PersonaTrail은 실제 업무, browsing history, memory를 평가 대상으로 끌어올렸고, QuantiBias와 물리 위험 평가는 비용 최적화나 단일 threshold 평가가 놓치는 안전 문제를 드러냈다. LangChain과 Claude context engineering 자료는 harness, context, memory, trace, eval을 팀이 소유해야 한다는 운영 기준을 강화한다.
무엇이 달라졌나
- 주요 반복 흐름: Open Source Models/Tooling, Evaluation, Agentic AI
- 핵심 해석: RAG/Data Quality, Agentic AI, Evaluation
- 커뮤니티 인기 신호와 공식/기술 근거를 분리해, 관심도와 사실성을 별도로 읽도록 구성했습니다.
왜 중요한가
- RAG와 agent는 별개 기능이 아니라 같은 품질 체계 안에서 평가해야 합니다.
- 오픈소스 릴리스는 바로 도입보다 breaking change, migration note, benchmark 유무를 먼저 봐야 합니다.
- HN/GeekNews/Lobsters의 인기 글은 시장 관심을 보여주지만, 제품 판단 근거로 쓰기 전 교차 확인이 필요합니다.
오픈소스/도구 신호
- How We Benchmark Deep Agents (langchain-blog, Hotness 26): agent workflow orchestration과 state transition 평가를 확인한다.
커뮤니티 관심 신호
- A tour of MLIR: The Dialect Stack Everyone Depends On (lobsters-ai, Lobsters engineering discussion 신호; RSS에는 점수/댓글 수가 제한적으로만 포함됨): AI 앱/RAG/agent 엔지니어링 관점에서 retrieval, tool boundary, state, 품질 지표와 연결되는지 확인할 후보입니다.
다음 행동
- 코딩 에이전트 평가는 단일 문제 풀이 대신 업무 도메인별 task directory, environment image, test harness, reference solution을 함께 관리한다.
- agent memory와 RAG 품질은 factual memory, preference memory, browsing trail, failure taxonomy로 분리해 측정한다.
- 양자화나 모델 교체는 비용과 latency만 보지 말고 open-ended multilingual bias, false positive, safety regression을 함께 테스트한다.
- 프롬프트와 지침은 계속 늘리기보다 Claude context engineering 사례처럼 불필요한 규칙을 줄이고 trace와 eval로 검증한다.
전주 대비 흐름
비교 기간: 2026-07-12 ~ 2026-07-18 → 2026-07-19 ~ 2026-07-25
2026-07-19 ~ 2026-07-25에는 오픈소스/도구 신호가 2026-07-12 ~ 2026-07-18보다 늘었습니다.
해석: 2026-07-12 ~ 2026-07-18에는 모델/API 릴리스, 오픈소스/도구, 커뮤니티 관심, 연구/논문 쪽이 많이 보였고, 2026-07-19 ~ 2026-07-25에는 모델/API 릴리스, 오픈소스/도구, 연구/논문, 커뮤니티 관심 쪽으로 관심이 옮겨갔습니다. 증가 신호는 RAG/검색/데이터, 평가와 품질 관리, 오픈소스/도구, 연구/논문입니다.
해석 신뢰도: medium
주제 축 변화
- RAG/검색/데이터: 2026-07-19 ~ 2026-07-25 301건 / 2026-07-12 ~ 2026-07-18 244건 / 증가 (+57)
- 평가와 품질 관리: 2026-07-19 ~ 2026-07-25 290건 / 2026-07-12 ~ 2026-07-18 214건 / 증가 (+76)
- 에이전트와 도구 호출: 2026-07-19 ~ 2026-07-25 374건 / 2026-07-12 ~ 2026-07-18 358건 / 증가 (+16)
- 서빙/런타임/운영: 2026-07-19 ~ 2026-07-25 191건 / 2026-07-12 ~ 2026-07-18 142건 / 증가 (+49)
- 보안/거버넌스: 2026-07-19 ~ 2026-07-25 264건 / 2026-07-12 ~ 2026-07-18 213건 / 증가 (+51)
출처 유형 변화
- 기업/공식 발표: 2026-07-19 ~ 2026-07-25 23건 / 2026-07-12 ~ 2026-07-18 23건 / 비슷함 (+0)
- 오픈소스: 2026-07-19 ~ 2026-07-25 236건 / 2026-07-12 ~ 2026-07-18 169건 / 증가 (+67)
- 커뮤니티 관심: 2026-07-19 ~ 2026-07-25 481건 / 2026-07-12 ~ 2026-07-18 666건 / 감소 (-185)
- 연구/논문: 2026-07-19 ~ 2026-07-25 892건 / 2026-07-12 ~ 2026-07-18 569건 / 증가 (+323)
- 기타: 2026-07-19 ~ 2026-07-25 190건 / 2026-07-12 ~ 2026-07-18 170건 / 증가 (+20)
핫 오픈소스/도구 레이더
openai-news · 2026-07-21
OpenAI and Hugging Face partner to address security incident during model evaluation
요약: OpenAI와 Hugging Face는 model evaluation 중 발생한 security incident의 early findings를 공유한다고 발표했다. 수집 본문은 advanced cyber capabilities와 defenders를 위한 lessons를 언급하지만 detail fetch가 실패해 세부 타임라인, 영향 범위, 완화 조치는 확보되지 않았다.
읽는 법: OpenAI 또는 Hugging Face의 상세 후속 글이 확보되면 incident timeline, affected scope, mitigation을 별도 보안 장기 맥락 후보로 검토한다.
원문 열기원문 링크: https://openai.com/index/hugging-face-model-evaluation-security-incident
hnrss-frontpage · 2026-07-21
Jack Dorsey launches Buzz to combine team chat, AI agents and Git hosting
요약: Buzz 기사에는 team chat, AI agents, Git hosting을 결합하려는 제품 방향과 shared identity, signed events로 agent를 accountable participant로 만들려는 설명이 나온다. Jack Dorsey의 agent-centered operating thesis를 open-source product로 옮긴다는 해설도 포함되어 있다.
읽는 법: Buzz는 제품 검토 후보로만 두고, README와 보안 모델이 확보되기 전에는 도입 후보로 올리지 않는다.
원문 열기원문 링크: https://runtimewire.com/article/jack-dorsey-block-buzz-team-chat-ai-agents-git
커뮤니티 관심 신호
hnrss-frontpage · 2026-07-22
Are AI Labs Pelicanmaxxing?
요약: Pelicanmaxxing 글은 Simon Willison의 pelican riding a bicycle 프롬프트가 비공식 모델 비교로 널리 쓰이게 된 맥락을 다룬다. 글은 tongue-in-cheek benchmark가 모델 릴리스 관찰의 유명한 informal benchmark가 되었다고 설명한다.
읽는 법: 현재 모델 비교 문서에서 informal visual prompt와 실제 서비스 task의 가중치를 분리해 표시한다.
원문 열기원문 링크: https://dylancastillo.co/posts/pelicanmaxxing.html
최신 근거 하이라이트
arxiv-cs-cl · 2026-07-25
QuantiBias: Benchmarking Quantization-Induced Bias in LLMs
요약: QuantiBias는 양자화된 LLM이 표준 안전 평가에서는 문제가 없어 보여도 open-ended 질문에서 bias가 늘어나는지 측정한 벤치마크다. 논문은 harmful request refusal, benign prompt over-refusal, multiple-choice answer는 유지되지만, eight languages의 open-ended answers 중 independent judge 기준 약 24%에서 stereotypes가 나왔다고 설명한다.
읽는 법: 현재 inference 비용 절감 실험에 eight-language open-ended prompt와 independent judge 기준을 추가한다.
원문 열기원문 링크: https://arxiv.org/abs/2607.21063
주요 기사
langchain-blog · 2026-07-23 · official
How We Benchmark Deep Agents
요약: LangChain은 Deep Agents를 open source, model agnostic agent harness로 설명하며 agent design이 어려운 이유 중 하나가 evaluation 난도라고 말한다. 글은 robust evaluation과 benchmark를 반복적으로 개선하며 Deep Agents 개발에 적용하는 흐름을 소개한다.
읽는 법: agent workflow 후보를 비교할 때 tool 지원 수가 아니라 실패 재현, benchmark 업데이트, 관측 로그 연결 여부를 표로 만든다.
원문 열기원문 링크: https://www.langchain.com/blog/how-we-benchmark-deep-agents
anthropic-news · 2026-07-24 · official
Introducing Claude Opus 5 Product Jul 24, 2026 Opus 5 is a step change improvement for the Opus tier powering long-running agents while delivering improvements in coding and professional work.
요약: Anthropic은 Claude Opus 5를 발표하며 Opus tier의 long-running agents와 coding, professional work 개선을 강조했다. 수집 본문은 Claude Opus 5가 available today라고 설명하고, Claude Fable 5에 가까운 frontier intelligence를 half the price로 제공한다고 소개한다.
읽는 법: 내부 agent benchmark에서 Opus 5, 기존 Opus tier, 다른 provider 모델을 같은 trace와 approval boundary로 재실행한다.
원문 열기원문 링크: https://www.anthropic.com/news/claude-opus-5
arxiv-cs-cl · 2026-07-25 · research
PersonaTrail: Benchmarking Personalized Web Agents through Browsing Trails
요약: PersonaTrail은 개인화 웹 에이전트가 사용자의 raw browsing histories에서 빠진 맥락을 추론하는지 평가하는 벤치마크다. 논문은 realistic browsing trajectories를 사용자 기록으로 쓰고, PACMem이 factual memories와 preference memories를 나눠 개인화 navigation에 활용한다고 설명한다.
읽는 법: 현재 서비스의 personalization eval에 과거 browsing trail, 선호 추론, 과거 사실 회상 케이스를 별도 축으로 추가할 수 있는지 본다.
원문 열기원문 링크: https://arxiv.org/abs/2607.20482
lobsters-ai · 2026-07-24 · community
A tour of MLIR: The Dialect Stack Everyone Depends On
요약: MLIR 글은 XLA, Triton 같은 모델 컴파일 경로 아래에 있는 공통 IR 계층을 설명한다. 본문은 SSA, regions and blocks, pass infrastructure, pattern rewriter, location tracking, verification 같은 공통 부분을 한 번 만들고, 도메인 차이는 dialect로 표현한다고 정리한다.
읽는 법: 런타임 성능 이슈 문서에 XLA, Triton, MLIR dialect, lowering 단계 용어를 정리해 둔다.
원문 열기원문 링크: https://hiraditya.github.io/posts/mlir-dialect-stack-for-ml
arxiv-cs-cl · 2026-07-25 · research
Frontier Financial Judgement: Can agents tell what might move a stock?
요약: Frontier Financial Judgement는 전문 equity analyst와 함께 만든 금융 판단 벤치마크다. 논문은 656개 뉴스 항목을 평가했고, 가장 강한 agent도 expert label 전체 일치가 52.4%에 그쳤으며 false-positive rate 추정이 약 1%에서 32%까지 갈렸다고 밝힌다.
읽는 법: 고위험 도메인 agent에는 expert label 샘플, false positive 한도, 사람 승인 경계를 별도 KPI로 둔다.
원문 열기원문 링크: https://arxiv.org/abs/2607.20645
다음에 볼 것
- RAG/vector DB/retrieval pipeline에서 freshness, recall, context precision, citation traceability를 어떻게 평가할지 확인
- LangGraph/LangChain/MCP 기반 workflow에서 state transition과 tool boundary를 어떻게 평가할지 확인
- agent/RAG benchmark는 실제 서비스 task, regression trace, security/secret leakage 기준으로 나눠 추적
- 본문이 얇게 수집된 출처는 selector 개선 후 재수집하고 공식 문서로 교차 확인
확인 필요
- 일부 raw Markdown은 feed excerpt 수준이므로 깊은 기술 판단 전 원문 확인 필요
- 커뮤니티 출처는 초기 신호로만 사용하고 공식 출처로 교차 검증 필요
