AI) 한테 문명 시켜보기
GPT 설명
CivBench는 문명 VI 한 판 전체를 300턴 이상 수행하게 하면서, LLM 에이전트가 장기간 계획을 유지하고 상태를 추적하며 수천 번의 도구 호출을 안정적으로 수행할 수 있는지를 평가하는 벤치마크다.
게임 조작은 화면을 직접 보는 방식이 아니라 76개의 MCP 도구를 통해 이루어지며, 상태 조회·유닛 조작·도시 관리·외교·연구·정부 운영 등 실제 에이전트형 소프트웨어와 유사한 도구 사용 구조를 갖는다.
실험에는 Claude Opus 4.6 8회, Gemini 3.1 Pro 6회, GPT-5.4 8회, Kimi K2.5 1회의 총 23개 유효 게임이 포함되었으며, Kimi는 표본이 1회뿐이라 탐색적 결과로 취급된다.
Claude Opus 4.6
2승 6패
Gemini 3.1 Pro
1승 5패
GPT-5.4
0승 8패
Kimi K2.5
0승 1패
Fisher 검정 p=0.488로 모델 간 우열을 통계적으로 판단할 수 없었다.
* 표본이 적어서 승패만으로는 우열을 나눌 수 없다는 뜻
이 논문의 핵심은 승률보다 행동 과정이며, 에이전트가 중요한 정보를 스스로 얼마나 자주 확인하는지를 PMR(Proactive Monitoring Rate)로 측정한 결과 Claude 1.26%, GPT-5.4 2.13%, Gemini 0.96%, Kimi 1.86%로 모두 낮았다.
특히 승리 진행 상황은 플레이북에서 20턴마다 확인하도록 지시했지만 실제 모델들은 약 30~75턴마다 한 번씩만 확인했고, 전체 도구 호출 중 승리 관련 모니터링은 약 0.05~0.29%에 불과했다.
이러한 모니터링 부족은 실제 패배와 연결되어 Claude는 탐지 가능한 패배 6회 중 3회, Gemini는 5회 중 1회, GPT-5.4는 8회 중 4회에서 종료 직전 20턴 동안 승리 진행 상황을 조회하지 않았다.
또한 RAG@10(Reflection?Action Gap)을 통해 모델이 자신의 계획에 적은 행동을 10턴 안에 실제로 수행하는지 평가했는데, Claude Opus 4.6은 48.2%, Gemini 3.1 Pro는 65.8%, GPT-5.4는 63.2%였고 Kimi는 충분한 약속 표본이 없어 이 분석에서 제외되었다.
즉 모델들은 “도시를 세우겠다”, “캠퍼스를 건설하겠다”, “승리 진행 상황을 확인하겠다”처럼 구체적인 계획을 언어로 표현할 수 있었지만, 상당수 계획을 실제 행동으로 이어가지 못해 추론 능력과 실행 능력 사이의 간극을 보였다.
따라서 CivBench가 보여주는 핵심 문제는 어떤 모델이 더 똑똑한가가 아니라, 강력한 최신 LLM도 장기 환경에서는 필요한 정보를 계속 확인하고 과거의 계획을 유지하며 실행하는 데 실패할 수 있으므로 장기 에이전트 평가에는 모니터링, 메모리, commitment tracking 같은 실행 신뢰성 지표가 필요하다는 점이다.
--
GPT 요약
CivBench는 문명 VI를 이용해 AI가 수백 턴 동안 도구를 쓰며 계획을 세우고 실행하는 능력을 평가하는 벤치마크입니다.
실험 결과, 최신 AI들도 중요한 정보를 제때 확인하지 않거나 자신이 세운 계획을 실제 행동으로 이어가지 못하는 경우가 많았습니다.
AI가 잘 생각하는가 보다 오랫동안 상황을 놓치지 않고 계획대로 행동할 수 있는지를 장기형 AI 에이전트의 핵심 과제임을 보여줍니다.
--
어떤 모델이던간에(물론 다 낮은 버전이긴 한데) 장기적으로 기억하고, 확인하고, 실행하는 전체 과정이 불안정했다고 함.
실제로 장기 작업은 허상이다 라고 말하는 사람도 있었고.
그래서 GPT6 가 진정한 에이전트 AI 다 어쩐다 하는 것도, 저 장기 작업을 할 수 있는 놈이라서 그렇다는 설명도 봤었음.





게임이 길어질수록 환각이나 치매가 온다는 것인가
ㅇㅇ 10턴 전에 한 행동을 기억하지 못하기도 하고 막 그렇다고 함
나도 문명하면 10턴 이전에 한거 기억 못 하는데!
아스트라는 전승할듯
아스트라는 가능할 것 같은데
토큰이 감당이 안될 듯 ㅋㅋㅋㅋㅋ
개비싸긴혀 ㅋㅋ
한다고 말만 하고 안 하다 망함. 이미 사람이네.
엌ㅋ
GPT 5.4면 대체 얼마나 옛날꺼야 ㅋㅋㅋ 지금이 GPT6인데
글킨한데 개인적인 생각으로는 5.6sol 이랑 페이블5.1 도 저거 못함
장기 기억에서 막힘
사고가 길어질수록 필요한 자원이 기하급수적으로 늘어나서 맥락적 사고를 길게 요구하는 종류의 문제 해결은 어렵다고 듣긴 했음.