뉴스
-
SKT 독자 AI 모델 'A.X K2' 수학도 잘한다..."올림피아드 금메달 수준"
자연어 평가에서는 그럴듯한 답변과 정확한 답변을 구분하기 어려운 경우가 있으나 수학 문제는 결과의 정확성을 비교적 명확하게 확인할 수 있다.이 때문에 높은 수학 추론 능력은 금융·회계뿐 개 매개변수로 개발된 AI 모델로 수학과 과학 추론 능력, 한국 지식과 장문 추론 능력을 강화된 점이 특징이다.
zdnet.co.kr · 2026.08.11
-
2026 국제기초과학대회, 베이징에서 개막
수학, 물리학, 공학 분야에 걸쳐 기여한 과학자 9명이 첫 ICBS 메달을 수상했다. 프런티어 과학상은 20여 개 국가 및 지역에서 발표된 영향력 높은 독창적 연구 논문 111편을 선정해 시상했다.
zdnet.co.kr · 2026.08.14
-
팀스파르타 초경량 언어모델, 'K-AI 리더보드' 초고난도 추론 1위
수학, 과학, 인문학 등 100여 개 분야 전문가가 출제한 2500개 문항으로 구성돼 최상위 AI 모델조차 통과가 까다로운 평가로 알려져 있으며, K-AI 리더보드의 핵심 평가 지표 파라미터의 초경량 모델이 수백억에서 수천억 개 규모의 대형 모델들을 제친 결과로, 상위 10개 모델의 평균(약 38.7B)과 비교하면 20분의 1 크기로 거둔 성과다.
zdnet.co.kr · 2026.07.20
-
"제조부터 국방까지"…SKT, '일하는 AI' 확산 시동
실행하는 AI'로 진화한 것”이라며 “에이전틱 시대에 맞춰 추론 능력을 크게 강화했고 특히 수학과 한국어 영역에서 의미 있는 성과를 냈다”고 밝혔다.A.X K2는 총 6880억 개 추론 과정에서는 330억 개(33B)의 매개변수만 활성화하는 MoE 구조를 적용해 모델 규모를 키우면서도 추론 비용은 기존 수준으로 유지했다.매개변수를 늘리며 성능은 크게 향상됐다.
zdnet.co.kr · 2026.08.04
-
같은 실수 반복하던 AI, '오답노트' 200개 쌓자 합격률이 62%에서 85%로
연구진은 이 문제를 수학 애니메이션 제작 과제에서 확인했다. 이때 사용한 도구가 매님(Manim)이다. 검증된 기억은 200여 개 규모에서만 확인됐고, 수백만 개 규모로 커지면 중복 제거와 정리가 필요할 가능성이 있다.
zdnet.co.kr · 2026.08.06
-
中 문샷, 신형 AI '키미 K3' 공개…오픈AI·앤트로픽 턱밑 추격
키미 K3는 총 2조8천억 개 파라미터를 갖춘 전문가 혼합(MoE) 방식의 초거대 AI 모델이다. 896개의 전문가 네트워크 가운데 일부만 선택적으로 활성화하는 구조를 통해 성능과 코드 생성 능력을 평가하는 라이브코드벤치에서는 53.7점을 얻었으며, 수학 추론 평가인 AIME 2025에서는 99.1점, 대학원 수준 과학 문제 해결 능력을 측정하는 GPQA-다이아몬드에서는
zdnet.co.kr · 2026.07.18
-
[AI는 지금] 업스테이지 '솔라 오픈 2' 출격…독파모 2라운드 승부수
모델 가중치는 글로벌 오픈소스 플랫폼 허깅페이스에 공개됐으며 아키텍처와 학습 방법론 전반을 담은 테크 리포트도 공개됐다.솔라 오픈 2는 총 2500억 개 매개변수 중 실제 작업 시 전작 '솔라 오픈'과 비교하면 과학추론(GPQA-Diamond), 수학(HMMT), 코딩 등 주요 벤치마크에서 20점 이상 올랐다.한국어 성능도 고도화했다.
zdnet.co.kr · 2026.07.23
-
[안광섭 AI 진테제] 독파모 2차평가 눈앞...무엇을 '평가' 해야 하나
자체 개발 벤치마크라는 한계는 분명하지만, '한국어 실무'라는 좁은 정의 안에서는 실제로 통한다는 근거다.네 모델이 자신 있게 앞세운 축을 정리하면 수학, 한국어 지식, 한국 문화· 기업이 AI에 예산을 쓰는 이유는 수학 문제를 잘 풀어서가 아니라 업무를 대신 끝내주기 때문이다.물론 이 영역은 전 세계가 다 못한다. τ³-뱅킹에서 딥시크 V4 프로도 25.8점에
zdnet.co.kr · 2026.08.10