뉴스
- [현장] 오픈AI "AI 벤치마크 한계…토큰·비용·시간까지 고려해야" [지디넷코리아]인공지능(AI) 모델 평가를 단일 벤치마크 점수 중심으로 보는 방식에 한계가 있다는 주장이 나왔다. 그는 GPT-5.5가 기존 벤치마크상 이전 모델보다 소폭 개선된 수준처럼 보였지만, 출력 토큰 수 기준으로 성능을 다시 보면 더 큰 차이가 나타난다고 주장했다.
- [영화 속 AI윤리] 튜링 테스트와 기만적 지능 이것이 오늘날 일반적으로 ‘튜링 테스트’라고 불리는 평가 방식의 출발점이다.70여 년이 흐른 뒤 이 사고실험은 GPT-4를 대상으로 한 사전 등록 대화 실험에서 다시 구현되었다. 54%에서 인간으로 판정되었다(Jones & Bergen, 2023).실제 인간 참가자가 인간으로 판정된 비율은 67%로 GPT-4보다 높았다.
- 오픈AI는 왜 ‘루나’를 무료로 풀었을까 바로 오픈AI가 지난 2026년 8월 9일, 자사의 최신 모델인 ‘GPT-5.6 루나(Luna)’를 모든 무료 사용자에게 제한 없이 공개했다는 소식인데요. 반면 전략가 그룹은 이런 리스크마저도 시장 독점을 위한 일시적인 통과의례로 보는 경향이 강했습니다.
- 가짜뉴스 잡으려다 공론장 얼어붙나…가짜뉴스법 시행 첫날 ‘딜레마’ 법적 안정성을 중시하는 GPT 모델 기반의 패널은 헌법적 가치를, 현실적 규제 효용성을 따지는 Gemini 패널은 사회적 비용을, 그리고 저널리즘의 본질을 탐구하는 Claude 패널은 오늘 여러분이 보는 뉴스 한 줄, 게시글 한 토막의 무게가 어제와는 조금 다르게 느껴질지도 모르겠습니다.▶ 해당 보고서 보기 https://ameet.zdnet.co.kr/uploads