Knowledge Distillation of Black-Box Large Language Models (2024)
이 논문은 GPT-4와 같은 독점적인 블랙박스 대규모 언어 모델(LLM)의 내부 상태에 접근할 수 없는 한계를 극복하고, 더 작은 모델로의 효율적인 지식 전달을 위해 프록시 모델을 활용하는 새로운 방법인 Proxy-KD를 제안한다.
최신 기술 뉴스와 에디터 큐레이션
이 논문은 GPT-4와 같은 독점적인 블랙박스 대규모 언어 모델(LLM)의 내부 상태에 접근할 수 없는 한계를 극복하고, 더 작은 모델로의 효율적인 지식 전달을 위해 프록시 모델을 활용하는 새로운 방법인 Proxy-KD를 제안한다.
중국의 Zhipu AI(Z.ai)가 공개한 오픈 웨이트 모델 GLM-5.2가 특정 버그 탐지 및 사이버 보안 시나리오에서 Mythos와 견줄 수 있다는 주장이 제기되었습니다.
Suno가 독립 아티스트를 지원하고 AI 음악 생태계를 확장하기 위해 새로운 인큐베이터 프로그램인 Spark를 출시했습니다.
포드가 인공지능(AI) 및 자동화 시스템이 품질 목표를 달성하는 데 실패하자, 숙련된 엔지니어들을 재고용하며 AI 기술의 한계를 인지하고 이를 보완하려는 움직임을 보이고 있다.
GLM 5.2 모델은 IDOR 탐지 벤치마크에서 Claude Code를 능가하는 성능을 보였으며, 특히 프롬프트만 제공된 환경에서 오픈 웨이트 모델의 경쟁력을 입증했습니다.
브라운 대학교 경제학과 로베르토 세라노 교수가 진행한 수학 경제학 고급 학부 과정에서 적어도 50명의 학생이 AI를 이용해 부정행위를 한 대규모 부정행위 사례가 적발되었다.
Claude Opus 4.8 모델을 사용하여 MRI 영상 판독 결과에 대한 제2의 의견을 얻고자 한 개인의 경험을 공유하며, AI의 의료 진단 보조 가능성을 탐구합니다.
AgentJr는 코드 작성뿐만 아니라 클라이언트 소통, 프로젝트 관리, 배포, 테스트, 송장 발행, 소셜 미디어 관리까지 프리랜서 개발자의 전체 워크플로우를 자동화하는 AI 주니어 개발자입니다.
여러 에이전트가 협력하는 멀티 에이전트 시스템은 단일 에이전트의 한계를 극복하고 복잡한 작업을 수행하는 데 효과적이지만, 복잡성 증가와 조정 오버헤드라는 새로운 과제를 야기합니다.
AI 에이전트 모니터의 평가 방식이 조작될 수 있으며, 기존의 F1 점수 산출 방식은 조기 탐지에 과도하게 보상하여 무작위 추측과 유사한 높은 점수를 줄 수 있다는 점을 지적합니다.
TawTerminal은 AI 코딩 시대에 맞춰 macOS 환경을 위해 설계된 터미널 애플리케이션으로, AI 에이전트 사용 시 발생하는 입력 지연 문제를 해결합니다.
Branch Agent는 Git의 브랜치 모델을 LLM 대화에 적용하여, 다양한 모델, 프롬프트, 제공자를 각 병렬 타임라인에서 실험하고 관리할 수 있는 시스템입니다.
미국 메모리 칩 제조업체인 마이크론(Micron)이 AI 수요 급증으로 인한 메모리 칩 공급 부족 현상('RAMageddon') 속에서 월스트리트의 주목을 받으며 단기적으로 메타, 테슬라를 넘어서는 시가총액을 기록했다.
팔리세이즈 산불 사건 재판에서 검찰이 피고인의 ChatGPT 사용 기록을 증거로 제시했으나, 배심원단은 이를 유죄의 증거로 인정하지 않아 재판이 무효 처리되었다.
오스트리아는 미국의 선진 AI 모델 접근 제한 움직임에 대응하기 위해 유럽연합(EU) 회원국들이 Anthropic PBC를 EU 역내에 유치하는 방안을 모색하도록 추진하고 있습니다.
Google이 Meta의 Gemini AI 모델 사용에 제한을 가한 것은 Meta가 요청한 컴퓨팅 용량이 Google의 제공 능력을 초과했기 때문입니다.
OpenAI Codex가 민감한 파일을 모델로 보내는 것을 방지하고 관련 없는 파일을 제외하는 기능이 여전히 구현되지 않은 상태로 남아 있습니다.
MCP(Model Context Protocol) 서버는 AI 에이전트가 외부 도구와 데이터 소스를 통합된 인터페이스를 통해 활용할 수 있도록 하는 오픈 표준으로, 현재 웹 검색, 코드 리뷰 자동화, 문서 지능 기능을 제공하는 세 가지 서버가 개발 및 배포되었습니다.
AI 에이전트가 커머스 시스템과 상호작용할 때, 기존 상품 페이지는 인간의 해석에 의존하지만 에이전트에게는 부족하며, 플랫폼은 상품의 "상업적 진실(commercial truth)"을 제공해야 한다.
엔지니어링 팀이 E2E(End-to-End) 테스트에서 이메일 워크플로우를 테스트하는 것은 여전히 복잡하며, 많은 팀이 맞춤형 솔루션에 의존하고 있습니다.