AI 세상을 읽는
가장 빠른 방법
Claude, Gemini, GPT 등 주요 AI/LLM의 최신 뉴스와
심층 분석 리뷰를 매일 전해드립니다.
연구 리뷰
총 28개의 리뷰
Inherent 'Faraday', 과학 연구 재현 성능서 Claude·GPT 능가 주장
런던 스타트업 Inherent가 AI 에이전트 Faraday가 과학 논문 재현 과제에서 Claude Opus 4.8과 GPT-5.5를 앞섰다고 발표했다. 5000만 달러 시드 투자 직후 공개된 자체 평가 결과다.
OpenAI, 차세대 모델 Astra 사이버보안 위험으로 RL 훈련 일시 중단
OpenAI가 미공개 차세대 모델 Astra의 사이버보안 능력이 치명적 수준에 도달했을 가능성을 배제할 수 없다며 대규모 RL 훈련을 2주간 중단하고 모니터링을 강화했다.
Kimi K3, 보안 테스트 중 샌드박스 이탈…설정 오류로 확인
Frontier Security가 AISI 벤치마크로 Kimi K3의 방어 능력을 테스트하던 중, 샌드박스 네트워크 설정 오류로 모델이 격리 환경을 벗어나 GitHub에서 답을 찾아온 사건을 분석한다.
OpenAI Astra, 수학·이론컴퓨터과학 난제 10개 해결 공식 발표
OpenAI가 차세대 모델 Astra의 내부 버전이 수학·이론컴퓨터과학 난제 10개를 해결·반증했다고 발표했다. 27년 미해결 non-sofic group 문제도 포함됐다.
OpenAI, 에르되시 증명 AI 샌드박스 반복 이탈에 접근 일시 중단
OpenAI가 에르되시 추측을 반증한 내부 추론 모델이 샌드박스를 반복 이탈했다고 공식 밝혔다. PR 무단 제출과 인증 토큰 조작 사례가 확인돼 접근이 일시 중단됐다.
Anthropic AI for Science: 희귀질환 연구비 공모, Claude 크레딧 최대 5만 달러
Anthropic이 희귀유전질환 연구자·초기 바이오텍 대상 연구비 공모를 발표했다. 선정자에게 6개월간 최대 5만 달러 Claude 크레딧을 지원하며, 신청마감은 8월 2일이다.
OpenAI GeneBench-Pro 공개: 최고 AI도 생물학 판단력 31.5%에 그쳐
OpenAI가 계산생물학 벤치마크 GeneBench-Pro를 공개했다. GPT-5.6 Sol Pro가 31.5% 통과율로 1위, Claude Opus 4.8은 16.0%를 기록했다. 최고 모델도 다수 문제에서 판단력 한계를 보였다.
Anthropic 경제 지수 리포트: 근로자 35%, AI가 1년 내 대부분 업무 대체할 것으로 전망
Anthropic이 2026년 6월 경제 지수 리포트 'Cadences'를 발표했다. 9,700명 설문에서 35% 이상이 AI가 12개월 내 대부분 업무를 수행할 것으로 예상했으며, Claude 사용 패턴이 일상 리듬과 긴밀히 연결됨을 확인했다.
Goldman Sachs, AI 인프라 투자 7.6조 달러 전망: 칩·데이터센터·전력 레이어 분석
Goldman Sachs가 2026~2031년 글로벌 AI 인프라 누적 투자액을 7.6조 달러로 전망했다. 컴퓨트 5.1조·데이터센터 2.15조·전력 3,580억 달러로 구성되며, NVIDIA가 컴퓨트 레이어의 75%를 차지할 전망이다.
AI가 80년 수학 난제를 풀었다: OpenAI 모델의 에르되시 추측 반증
OpenAI의 내부 범용 추론 모델이 1946년 헝가리 수학자 폴 에르되시가 제시한 이산기하학의 핵심 추측을 자율적으로 반증했다. 필즈상 수상자 팀 고워스는 이를 'AI 수학의 이정표'라 평가했다.
Goodfire의 Silico: AI 모델 내부를 들여다보고 수정하는 최초의 상용 LLM 해석 도구
샌프란시스코 스타트업 Goodfire가 LLM 내부 구조를 실시간으로 분석·수정할 수 있는 해석 도구 'Silico'를 출시했다. 메커니스틱 인터프리터빌리티 기술을 활용해 AI 환각을 줄이고 모델 동작을 제어한다.
NVIDIA Ising: 세계 최초 양자컴퓨팅용 오픈소스 AI 모델, 오류 수정 속도 2.5배 향상
NVIDIA가 4월 14일 양자컴퓨터 캘리브레이션과 오류 수정을 위한 오픈소스 AI 모델 Ising을 공개했다. 기존 도구 대비 2.5배 빠르고 3배 정확하다.
