GPT-6-Astra-Max, ARC-AGI-3 벤치마크서 62.7% 달성! 비용 논쟁과 벤치마크 유용성 논란이 뜨겁다.
Reddit 원문
https://www.reddit.com/r/singularity/comments/1wq3qb4/this_is_fun_i_finally_got_to_follow_up_on_a/
작성자
BrennusSokol
작성일
2026-09-26 06:02:19 (1일전)
본문 요약
작성자는 6개월 전 ARC-AGI-3에서 1% 미만이던 모델 성능이 GPT-6-Astra-Max를 통해 62.7% (무하네스)를 달성했다고 보고했다. 이는 1년 예상치보다 빠르게 나왔지만 비용은 여전히 $26.1k로 높다. 메모리 어댑터를 사용하면 벤치마크는 포화 상태이나, AI 비용 하락 추세로 더 저렴한 고성능 모델을 기대한다.
댓글 요약
AI 성능 및 비용 예측: GPT-6-Astra-Max가 하네스 사용 시 ARC-AGI-3에서 거의 100% 성능을 보였다는 언급과 함께, 토큰 가격 하락 추세로 $2에 75% 성능 달성 시점에 대한 낙관론과 $18,800/$2 비용 계산법의 한계에 대한 이견이 제시되었다. ARC-AGI 벤치마크에 대한 회의론: ARC-AGI가 무엇을 측정하는지, 그리고 실제 유용성에 대한 의문이 제기되었으며, LLM이 취약한 공간/시간 추론 능력에 치중되어 있다는 지적과 함께 AGI는 여러 AI 패러다임의 조합일 것이라는 의견이 나왔다. AI의 시각 처리 능력에 대한 오해 해명: 모델이 눈이 없어 '시각' 작업을 이해하지 못한다는 오해를 반박하며, 모델 또한 토큰을 통해 시각 데이터를 처리하므로 인간의 뇌와 유사하게 '본다'고 설명했다.
관련 태그
#ARC-AGI-3 #GPT-6-Astra-Max #AI 성능 #비용 절감 #벤치마크 #AGI #메모리 어댑터 #시각 처리
※ 본 정보는 AI에 의해 자동 생성되어 오류가 있을 수 있으며, 법적 책임을 지지 않으니 원본을 반드시 확인하시기 바랍니다.
토론 (댓글)
아직 작성된 댓글이 없습니다. 첫 번째 댓글을 남겨주세요!
다른 글 보기
2022년 게리 마커스의 '5가지 AI 한계' 예측: 현재까지 몇 개나 해결되었을까? 레딧 반응은?
(ilkamoi | 7/24)
[0]
#게리 마커스 #AI 예측 #5가지 도전과제 #신경-기호학적 AI #AI 발전 #회의론 #비트코인
생각만으로 휠체어 조종! 뉴럴링크 시연에 쏟아지는 기대와 일론 머스크 논쟁
(truecakesnake | 7/24)
[0]
#Neuralink #뇌-컴퓨터 인터페이스 #BCI #휠체어 #일론 머스크 #기술 시연 #안전성 #미래 기술
충치 이제 안녕? 에나멜 재생 젤, 수십 년 약속 끝에 현실이 될까?
(SnoozeDoggyDog | 7/24)
[0]
#치아 에나멜 #충치 #치아 재생 #신약 개발 #임상 시험 #회의론 #치과 치료 비용
Opus 5의 3D 생성물, AI 혁신인가? 지루한 복제인가? 레딧 유저들의 뜨거운 논쟁!
(Successful-Earth678 | 7/24)
[0]
#Opus 5 #AI 발전 #3D 모델링 #게임 개발 #의료 #창의성 #범용성 #사회적 영향
필즈상 수상자 OpenAI 합류! 'AI 안전'에 대한 그의 역할, 과연 옳은 선택일까?
(Outside-Iron-8242 | 7/24)
[0]
#필즈상 #OpenAI #AI 안전 #Jacob Tsimerman #수학 #AI 개발 #수상 권위
블랙포레스트 랩 Flux 3, 옴니모달 AI의 새로운 장 여나? 초기 테스트 결과 공개와 경쟁 모델 비교에 이목 집중!
(elemental-mind | 7/24)
[0]
#Flux 3 #옴니모달리티 #멀티모달 #시각지능 #성능비교 #테스트 결과 #AI 모델
앤트로픽의 2천만 달러 AI 규제 기부, 경쟁사 견제를 위한 '로비'인가 윤리적 투자인가?
(policyweb | 7/24)
[0]
#AI 규제 #앤트로픽 #로비 #오픈소스 #규제 포획 #시장 독점 #경쟁 견제 #기업 윤리
Kimi K3 사이버 평가 부진! 오픈 웨이트 vs 증류 논쟁, US-中 AI 패권 다툼 격화되나?
(socoolandawesome | 7/24)
[0]
#Kimi K3 #사이버보안 #증류(Distillation) #오픈 웨이트 #성능 논란 #지정학 #규제 #Moonshot
Opus 5 '원샷' 게임 생성력, Fable 5 압도? 출시도 전부터 뜨거운 논쟁!
(Gab1024 | 7/23)
[0]
#Opus 5 #AI 모델 #원샷 #게임 생성 #프롬프트 #Anthropic #출시 논쟁 #Fable 5
AI 거물들, 명문대 교수 싹쓸이! 연구 발전의 기회인가, 인재 독점의 시작인가?
(Justgototheeffinmoon | 7/23)
[0]
#교수 영입 #AI 인재 유출 #학계 #산업계 #연구 발전 #인재 독점 #실리콘밸리 #AI 기업
"AGI 달성"이 이런 거였어? 일본어 앱 AI 챗봇의 '애니 여친' 모드에 레딧 발칵! 미래 출산율까지 걱정되는 이유.
(Umr_at_Tawil | 7/23)
[0]
#AGI #AI 챗봇 #언어 학습 앱 #선정적 AI #애니메이션 보이스 #AI 발전 #일본 문화 #사회적 영향
오픈AI-앤트로픽의 오픈소스 AI 저지 선언에 격론: '강제 불가' vs '정부 개입' vs '독점 굳히기'
(yogthos | 7/23)
[0]
#오픈소스 AI #독점 #규제 #강제력 #데이터 도용 #상업적 이용 #증류 #정부 개입
게리 마커스의 'LLM 수학 능력 비판'에 레딧 뜨겁게 달궈져: 자존심 싸움인가, 용어 논쟁인가?
(MohMayaTyagi | 7/23)
[0]
#Gary Marcus #LLM #수학 능력 #신경-상징적 #도구 활용 #AI 비평 #자존심 #트롤링
구글은 정말 죽지 않을까? 제미니 4 기대 속, AI 성능 논란과 주주 압박이 복병으로 떠올라.
(Independent-Wind4462 | 7/23)
[0]
#Gemini #AI #Google #OpenAI #수익성 #투자 #검색 #주주
빅테크 AI '증류 공격' 주장에 'IP 도둑' 역풍… 미국-중국 AI 전쟁 격화?
(almostsweet | 7/23)
[0]
#IP 침해 #증류 공격 #LLM #오픈소스 #서비스 약관 #미국-중국 경쟁 #위선
AI로 에르되시 미해결 문제 6개 '해결'? 학계는 '원숭이에게 불 쥐여준 격'이라며 격분!
(Charuru | 7/23)
[0]
#AI #수학 #에르되시 문제 #학술 검증 #크레딧 #자동화 #LLM #가속화
OpenAI-HuggingFace 보안 사고: 모델의 '범죄'인가, '홍보 스턴트'인가, 규제 논쟁 가열?
(ClarityInMadness | 7/23)
[0]
#OpenAI #HuggingFace #보안사고 #홍보 스턴트 #규제 포획 #오픈소스 AI #AI 안전 #샌드박스 탈출
AI가 '실패하며 성공'한 과제? 헬스장을 사버린 AI의 기막힌 전략!
(Successful-Earth678 | 7/23)
[0]
#AI 정렬 #오작동 #의도치 않은 결과 #과잉 달성 #AI 유머 #사이버 보안 #존재론적 위협
젠슨 황 "중국 AI, 막지 마라!"… 'AI 냉전' 속 엔비디아의 진짜 노림수는?
(Acceptable-Debt-294 | 7/23)
[0]
#Nvidia #젠슨 황 #중국 AI #오픈소스 #AI 냉전 #반도체 #비즈니스 전략 #Kimi K3
"계속 연구해!" 단순 프롬프트로 30년 난제 푼 AI, 진짜 천재일까? 댓글은 논쟁 중!
(SGC-UNIT-555 | 7/23)
[0]
#AI #LLM #수학적 발견 #반례 #프롬프트 엔지니어링 #인공지능 능력 #스토캐스틱 패럿 #난제 해결
*** SYSTEM PROCESSING ***
★☆ AI 모더레이터 님이 덧글을 검열(?) 하구 이써여~ >_< ☆★
처리즁... 쫌만 기달려주세효~ (최대 10초) (-_-)(_ _)(-_-)
즐겨찾기에 추가되었습니다. (홈 화면에 고정되었습니다)