OpenAI, 벤치마크 30% 오류 주장! 경쟁사 견제인가, AI 평가 기준의 근본적 문제인가?
| Reddit 원문 | https://www.reddit.com/r/singularity/comments/1ur9835/openai_finds_30_of_tasks_in_swe_bench_pro_are/ |
| 작성자 | FateOfMuffins |
| 작성일 | 2026-07-09 08:24:14 (7/9) |
| 본문 요약 | OpenAI가 SWE Bench Pro 벤치마크의 약 30% 태스크에 문제가 있음을 발견했다고 발표했다. |
| 댓글 요약 |
|
| 관련 태그 | #OpenAI #SWE Bench Pro #벤치마크 #Anthropic #모델 평가 #유효성 논란 #AI 성능 #암기 학습 |
※ 본 정보는 AI에 의해 자동 생성되어 오류가 있을 수 있으며, 법적 책임을 지지 않으니 원본을 반드시 확인하시기 바랍니다.
토론 (댓글)
아직 작성된 댓글이 없습니다. 첫 번째 댓글을 남겨주세요!