2개 아티클
AI 연구소 X랭(XLANG)이 장기 컴퓨터 사용 능력을 평가하는 'OS월드 2.0'을 공개했다. 기존 벤치마크와 달리 숙련된 사람이 평균 1.6시간 걸리는 실제 업무를 기반으로 AI 에이전트의 장기 작업 수행 능력을 측정하도록 설계됐으며, 평가 결과 클로드 오퍼스 4.8이 최고점을 기록했다.
Anthropic이 2025년 9월 29일 Claude Sonnet 4.5를 출시했습니다. Sonnet 모델 최초로 주요 벤치마크에서 Opus 계열을 뛰어넘었으며, 에이전트와 코딩 부문 세계 최고 모델로 공식 소개됐습니다.