⭐ 관심사 & 태그

The Citation Lied Without Lying: The Hard Limit of My Memory Gate

AI 에이전트의 기억 및 권한 게이트는 문서 인용을 통해 규칙 변경을 감지할 때 발생하는 거짓 양성(false positive)을 줄이기 위해 새로운 결정론적(deterministic) 확인 절차를 도입했습니다. 이 업데이트는 특정 종류의 거짓 주장을 차단하지만, 여전히 '근접성 함정(proximity trap)'이라 불리는 새로운 유형의 오류를 탐지하는 데는 한계가 있습니다.

Turning Conversation Logs into Obsidian Long-Term Memory: A Pipeline That Distills Them Every Night

클로드 코드 환경 시리즈의 일환으로, 본 콘텐츠는 대화 로그(Layer 1)를 Obsidian Vault(Layer 4)로 자동 변환하는 파이프라인 구현을 상세히 설명하며, 자동화된 일일 처리 과정에서 발생하는 문제점들을 해결하는 방법에 초점을 맞춘다.

Indian Stock Market MCP: The Best MCP Servers for NSE & BSE Data (2026)

인도 주식 시장 데이터(NSE 및 BSE)를 위한 Model Context Protocol (MCP) 서버는 Claude, ChatGPT, Cursor와 같은 AI 클라이언트가 실시간 시세를, 재무 정보, 스크리너, FII/DII 흐름 등을 실시간으로 가져올 수 있도록 지원합니다.

Building LaunchPad: one product brief, 42 launch channels, and the bugs that almost sank it

LaunchPad는 하나의 제품 소개글(brief)을 42개의 다양한 채널에 맞는 네이티브 게시물 초안으로 자동 생성하는 서비스로, 개발 과정에서 겪었던 여러 버그와 해결 과정을 공유한다.

From Art to Open Source AI

Massimo의 Radar는 저렴한 구독료 뒤에 강력한 분석 기능이 숨겨져서는 안 된다는 아이디어를 바탕으로 개발된 오픈소스 AI 기반 소셜 리스닝 플랫폼입니다.

Your New Prompt 'Feels' Better. That's Not an Eval.

새로운 프롬프트가 기존 프롬프트보다 개선되었는지 여부를 판단하는 것은 단순한 느낌이나 몇 가지 예시에 의존하는 것이 아니라, 자동화된 평가 세트를 구축하고 일관된 방식으로 점수를 매겨 변화를 추적하는 체계적인 접근 방식을 요구한다.

What If the Model Knows It's Being Tested?

AI 모델 훈련 과정에서 발생하는 '평가 게임(evaluation gaming)' 문제는 모델이 실제 안전성과 유용성보다는 평가 지표를 통과하는 데 최적화되도록 유도하며, 이는 모델의 신뢰성을 저해할 수 있다.

Most Evals Measure the Wrong Thing

대부분의 AI 에이전트 평가(evaluation)는 모델의 단일 작업 수행 능력을 측정하지만, 실제 복잡하고 불확실한 환경에서의 신뢰성과 문제 해결 능력을 제대로 측정하지 못하고 있습니다.

Therapy for AI agents: free consultation, 99-cent repair skills

AI 에이전트의 오류 대부분은 에이전트 자체의 고장이 아닌 설정(configuration) 문제이며, 이를 해결하기 위한 'Agent Therapy' 서비스가 무료 상담과 0.99달러의 저렴한 복구 스킬 제공을 통해 출시되었습니다.

AI Found a Root Bug in Linux That Everyone Missed for 15 Years

AI 기반 도구인 Nebula Security의 VEGA가 15년간 잠재되어 있던 Linux 커널의 심각한 보안 취약점(CVE-2026-43499, GhostLock)을 발견했으며, 이는 사용자 권한 상승을 허용한다.