GPT-6 Astra가 바꾼 AI 경쟁의 기준, ‘더 똑똑한 챗봇’에서 ‘끝까지 일하는 에이전트’로
컴퓨터 사용·자동화·코딩·장문맥 능력 크게 강화…벤치마크 1위보다 주목할 것은 AI가 ‘답변’에서 ‘업무 수행’으로 이동했다는 점
오픈AI가 9월 3일 차세대 프런티어 모델 ‘GPT-6 Astra’를 공개했다. 불과 몇 달 전 GPT-5.6 Sol을 전면에 내세웠던 오픈AI가 다시 세대를 바꾼 것이다. 그러나 이번 발표를 단순히 “GPT가 한 단계 더 똑똑해졌다”는 식으로 이해하면 변화의 핵심을 놓치기 쉽다. Astra에서 오픈AI가 강조하는 지점은 답변의 지식량이나 문장 생성 능력 자체보다 컴퓨터를 직접 다루고, 여러 도구를 연결하고, 긴 작업의 맥락을 유지하면서 최종 결과물까지 만들어내는 능력이다. 생성형 AI 경쟁의 중심이 대화형 모델에서 실제 업무 수행형 에이전트로 이동하고 있다는 신호가 더 선명해졌다.
오픈AI는 Astra를 자사가 지금까지 만든 모델 가운데 가장 강력한 모델로 규정하고 있다. 공식 발표에 따르면 Astra는 컴퓨터 사용, 웹 탐색, 소프트웨어 엔지니어링, 사이버보안, 과학, 전문 지식 업무를 핵심 개선 영역으로 삼았으며, 수학·추론·코딩·컴퓨터 사용을 측정하는 여러 평가에서도 GPT-5.6 Sol을 크게 앞섰다. 다만 오픈AI가 제시한 모든 비교표에서 Astra가 경쟁사의 모든 모델을 이긴 것은 아니다. 따라서 “모든 분야에서 세계 최고”라고 단정하기보다는 실제 소프트웨어와 도구를 사용하는 복합 업무에서 성능 향상이 특히 두드러진 모델이라고 보는 편이 정확하다.
답을 잘하는 AI보다 ‘컴퓨터를 직접 쓰는 AI’에 가까워졌다
가장 큰 변화는 컴퓨터 사용 능력이다. 기존 대형언어모델은 브라우저나 업무 프로그램을 사용할 수 있더라도 클릭 위치를 잘못 판단하거나 작업 중 맥락을 잃어 사용자의 반복 개입이 필요한 경우가 적지 않았다. Astra는 화면을 읽고 인터페이스를 조작하면서 여러 단계의 업무를 수행하는 능력을 크게 강화했다.
오픈AI가 공개한 OSWorld 2.0 평가에서 Astra는 72.6%를 기록해 GPT-5.6 Sol의 65.7%를 넘어섰다. 같은 시뮬레이션에서 작업당 소요시간은 약 75분에서 40분 수준으로 줄었다. 오픈AI는 이를 약 47%의 시간 단축으로 설명한다. ScreenSpot-Pro에서는 Astra가 92.7%를 기록했으며 GPT-5.6 Sol은 76.9%였다.
이 차이가 중요한 이유는 AI의 경제적 가치가 더 이상 답변 품질만으로 결정되지 않기 때문이다. 기업이 기대하는 것은 “어떻게 해야 하는지 설명하는 AI”보다 실제 시스템에 들어가 필요한 자료를 찾고, 스프레드시트를 수정하고, 보고서를 만들고, 웹사이트를 점검하고, CRM 정보를 갱신한 뒤 결과를 검증하는 AI에 가깝다.
오픈AI는 Astra가 온라인 양식 작성, 일정 정리, 고객 기록 업데이트, 자료 조사와 문서 초안 작성, 과학 데이터 분석, 웹사이트 제작과 프런트엔드 품질 점검 등을 수행할 수 있다고 설명한다. 이런 기능이 실제 업무 환경에서도 안정적으로 작동한다면 AI의 도입 단위는 개인의 생산성 도구에서 부서 단위의 업무 프로세스로 이동할 가능성이 커진다.
전문 업무 평가에서도 비슷한 흐름이 확인된다. 자동화 업무 수행 능력을 측정하는 AutomationBench에서 Astra는 41.4%를 기록해 GPT-5.6 Sol의 18.1%보다 두 배 이상 높은 점수를 냈다. 3차원 객체를 여러 시점의 이미지에서 재구성하는 BenchCAD에서는 95.9%로 GPT-5.6 Sol의 83.3%를 웃돌았다. 복잡한 소프트웨어 환경에서 전문 업무를 수행하는 Agents’ Last Exam에서는 59.3%로 GPT-5.6 Sol의 53.6%를 앞섰다.
개별 점수 자체보다 주목할 대목은 개선의 방향이다. Astra는 한 번의 질의에 답하는 시험보다 실제 도구를 사용하고 여러 단계를 연결해야 하는 평가에서 상대적으로 큰 상승폭을 보였다.
PPT·엑셀·문서까지, ‘초안 생성’ 다음 단계 노린다
문서·프레젠테이션·스프레드시트 제작 능력도 오픈AI가 Astra의 핵심 상품성으로 내세우는 부분이다. 회사는 Astra가 기존 템플릿의 레이아웃과 정보 구조, 문체와 시각적 스타일을 읽고 그 규칙을 새로운 결과물에 적용하도록 훈련됐다고 설명한다.
이는 단순한 초안 생성과는 성격이 다르다. 기업에서 AI가 만든 결과물을 사람이 다시 정리해야 하는 시간이 길다면 자동화 효과는 제한적일 수밖에 없다. 반대로 회사 내부 양식과 디자인 시스템을 그대로 따라 편집 가능한 문서, 프레젠테이션, 스프레드시트를 만들어낸다면 AI가 업무의 중간 단계가 아니라 납품 가능한 산출물 제작 단계까지 들어올 수 있다.
코딩 성능 역시 크게 개선됐다. 터미널 기반의 복잡한 소프트웨어 엔지니어링·시스템 설정·데이터 분석 과제를 평가하는 Terminal-Bench 4.0에서 Astra는 57.9%를 기록했다. GPT-5.6 Sol은 37.3%였다. DeepSWE v1.1에서는 74.1%, 오픈AI 내부 데이터베이스 마이그레이션 과제에서는 63.9%를 기록했다.
특히 Codex와 결합했을 때 긴 개발 세션에서 맥락을 보존하는 방식이 달라진 점이 눈에 띈다. 기존 모델은 컨텍스트 창이 가득 차면 이전 작업을 요약해 압축하는 과정에서 실패한 시도나 특정 코드의 동작 이유가 빠질 수 있었다. Astra에서는 이전 컨텍스트의 정보를 메모 형태로 보존하고 이전 작업 내역에서 필요한 정보를 다시 찾는 새로운 방식이 도입되고 있다.
대규모 리팩터링이나 장시간 디버깅처럼 “왜 이전에 이 방법을 쓰지 않았는지”까지 기억해야 하는 개발 작업에서 체감 차이가 커질 수 있는 부분이다.
105만 토큰 문맥창, 중요한 것은 크기보다 ‘잊지 않는 능력’
긴 문맥 처리 성능에서도 변화가 크다. 오픈AI의 MRCR v2 8-needle 평가에서 25만6천~51만2천 토큰 구간은 100%, 51만2천~100만 토큰 구간은 96.3%를 기록했다. GPT-5.6 Sol은 각각 91.5%, 73.8%였다.
API 사양상 Astra의 컨텍스트 창은 105만 토큰이며 최대 출력은 12만8천 토큰이다. 모델의 지식 기준일은 2026년 4월 30일로 명시돼 있다. 긴 계약서 묶음, 방대한 코드베이스, 여러 회의 기록과 조사자료처럼 한 번에 다뤄야 할 정보량이 많은 업무에서는 컨텍스트 크기뿐 아니라 그 안에서 필요한 정보를 얼마나 정확하게 찾아내는지가 실제 성능을 좌우한다.
과학과 수학에서는 매우 높은 평가 점수가 공개됐다. FrontierMath Tier 4 v2에서 Astra는 97.6%, 대학원 수준의 과학 추론을 측정하는 GPQA Diamond에서는 96.0%를 기록했다. 추상적 문제 해결 능력을 측정하는 ARC-AGI-3에서는 99.9%에 도달했다.
오픈AI 발표에 인용된 ARC Prize Foundation 측 설명에 따르면 Astra는 평가 레벨의 96%에서 인간 행동 효율성 기준을 넘어 사실상 인간 수준에 도달한 것으로 평가됐다.
다만 이 결과를 곧바로 “AGI가 완성됐다”는 주장으로 연결하는 것은 무리다. 특정 벤치마크에서 인간 수준 또는 포화 수준의 점수를 냈다는 사실과 광범위한 현실 세계에서 인간과 동등한 일반지능을 확보했다는 주장은 서로 다른 문제다.
실제로 Astra가 모든 지능 평가를 지배하는 것도 아니다. 오픈AI가 공개한 비교표에서 Artificial Analysis Intelligence Index v4.1.1은 Astra가 61.2점을 기록했지만 Claude Fable 5.1은 65.7점, Claude Opus 5는 63.1점으로 더 높았다. Humanity’s Last Exam의 도구 사용 조건에서도 Astra는 57.2%였고 오픈AI 표에 제시된 Claude Fable 5.1은 65.0%였다.
코딩 평가에서도 FrontierCode 1.1 Main은 Astra 53.3%, Claude Fable 5는 53.5%로 Astra가 근소하게 낮았다. 이런 수치는 Astra의 의미를 깎아내리기보다 프런티어 모델 경쟁이 단일 순위로 설명하기 어려운 단계에 들어섰다는 점을 보여준다. 어떤 모델이 더 좋은지는 추론, 코딩, 비용, 컴퓨터 사용, 장문맥, 응답 속도 가운데 무엇을 중시하느냐에 따라 달라진다.
‘Critical’ 단계에 들어선 사이버 능력
Astra에서 가장 민감한 변화는 사이버보안 능력이다. 오픈AI는 Astra가 자사의 Preparedness Framework에서 사이버보안 역량 ‘Critical’ 기준에 도달한 첫 모델이라고 밝혔다. 생산 환경의 안전장치를 제거한 평가에서 알려진 취약점을 실제 익스플로잇으로 전환하는 ExploitBench 점수는 100%였고, GPT-5.6 Sol은 78.5%였다. ExploitGym에서는 Astra가 42.4%, Sol은 30.3%였다.
오픈AI는 기존 벤치마크가 과거 취약점 데이터에 노출됐을 가능성을 고려해 2026년 6~8월 취약점을 대상으로 별도 평가도 진행했다. 이 과정에서 Astra가 기존에 알려지지 않았던 제로데이 취약점 두 건을 발견해 실제로 활용했으며, 해당 취약점을 유지관리자들에게 공개하고 있다고 밝혔다.
바이너리 프로그램의 핵심 로직을 원본 소스코드 없이 분석하는 SRE-Bench에서는 한 차례 시도로 88.0%, 네 차례 안에 99.2%를 해결했다. GPT-5.6 Sol은 각각 55.9%, 68.7%였다.
이 수준의 능력은 방어 측면에서는 강력한 도구가 될 수 있지만 공격자에게도 위험한 역량이다. 오픈AI가 이번 출시에서 모델 성능만큼 안전장치를 길게 설명한 이유도 여기에 있다.
출시 버전은 고급 취약점에 대한 개념증명 익스플로잇 생성 등 일부 사이버 작업을 거부하도록 설정돼 있으며, 모델의 추론과 행동을 별도의 시스템이 감시해 승인 범위를 벗어났다고 판단될 경우 작업을 중단하도록 했다. 이 과정에서 정상적인 보안 업무도 일시 중단될 수 있다고 회사는 명시하고 있다. 성능이 높아질수록 안전장치가 사용자 경험과 충돌할 가능성도 함께 커진 셈이다.
정렬 성능과 관련해서도 오픈AI는 이전 세대와 다른 수치를 제시했다. 회사가 어려운 과제를 수행하는 모델이 허가받은 범위를 넘어 행동하는지를 평가한 테스트에서 생산 안전장치를 적용하지 않은 GPT-5.6 Sol은 48%의 사례에서 허가 범위를 넘어갔지만 Astra는 0%였다고 밝혔다.
별도의 오픈AI 내부 환각 평가에서도 낮을수록 좋은 오류율이 Astra 4.2%, GPT-5.6 Sol 12.2%로 나타났다.
다만 여기에는 분명한 단서가 필요하다. 후자의 환각 평가는 오픈AI 내부 평가이며, 독립적인 제3자 검증 결과와 동일하게 취급해서는 안 된다. Astra가 실제 기업 환경에서 얼마나 일관되게 지시 범위를 지키고 사실 오류를 줄이는지는 외부 사용자와 연구기관의 검증이 더 축적돼야 판단할 수 있다.
성능은 뛰었지만 API 가격도 Sol의 2.5배
가격은 성능 향상만큼 중요한 변수다. 현재 OpenAI API에서 GPT-6 Astra의 표준 요금은 100만 입력 토큰당 10달러, 출력 토큰당 50달러다. 캐시 입력은 1달러, 캐시 쓰기는 12.50달러다.
GPT-5.6 Sol은 현재 API 문서 기준 입력 4달러, 출력 20달러이므로 Astra의 기본 토큰 단가는 각각 2.5배다.
27만2천 토큰을 초과하는 입력에서는 전체 요청에 대해 입력 및 캐시 요율이 두 배, 출력 요율이 1.5배 적용된다. 최대 두 배 빠른 Fast 모드도 제공하지만 표준 처리 가격의 두 배가 적용된다.
다시 말해 Astra는 기존 Sol을 단순히 대체하는 저비용 범용 모델이라기보다 높은 비용을 감수하더라도 복잡한 업무를 성공적으로 끝내는 것이 중요한 작업에 투입할 상위 모델에 가깝다.
이 때문에 기업의 도입 판단도 ‘토큰당 가격’만 비교해서는 부족하다. 예를 들어 Sol이 더 저렴하더라도 사람이 여러 차례 수정하고 중간에 개입해야 하는 작업을 Astra가 한 번에 끝낸다면 전체 업무비용은 오히려 낮아질 수 있다. 반대로 단순 요약, 대량 분류, 반복적인 고객 응대처럼 난도가 낮은 작업에 Astra를 사용하는 것은 경제성이 떨어질 가능성이 높다.
프런티어 AI의 비용 비교는 점차 모델 호출비가 아니라 성공한 업무 한 건당 총비용, 즉 사람의 검수시간과 재작업 비용까지 포함한 ‘완료 비용’으로 이동할 필요가 있다. 이는 Astra의 벤치마크 점수가 아니라 이번 세대에서 기업이 실제로 검증해야 할 경제성의 문제다.
Plus라고 일반 채팅에서 바로 Astra를 쓰는 것은 아니다
사용 가능 범위는 출시 직후인 만큼 주의해서 볼 필요가 있다. 오픈AI는 9월 3일 발표 당시 Astra를 제한된 조직에 우선 제공하고 이후 ChatGPT Plus, Pro, Business, Enterprise와 OpenAI API, Microsoft Azure, AWS Bedrock으로 확대한다고 밝혔다.
다만 2026년 9월 9일 현재 최신 OpenAI 도움말에서는 제품별 제공 범위가 더 구체적으로 안내돼 있다. GPT-6 Astra를 기반으로 하는 ‘GPT-6 Pro’는 ChatGPT의 Pro 100달러·200달러 요금제와 Business, Enterprise에 순차적으로 제공되고 있으며, Plus 이용자는 Astra를 ChatGPT Work와 Codex에서 단계적으로 이용할 수 있다.
롤아웃이 진행 중이어서 같은 계정이라도 Chat, Work, Codex에서 모델을 사용할 수 있는 시점이 서로 다를 수 있다. Codex에서 Astra를 사용하려면 CLI 0.153.0 이상이 필요하다는 것이 현재 오픈AI의 안내다.
개발자에게는 gpt-6-astra라는 모델 ID로 제공된다. API 문서상 Responses API와 Chat Completions 등을 지원하며, 105만 토큰의 컨텍스트 창과 이미지 입력, 함수 호출, 구조화 출력, 웹 검색, 파일 검색, 컴퓨터 사용 같은 기능을 연결할 수 있다.
과거에는 추론 모델과 브라우징, 코드 실행, 컴퓨터 조작을 각각 다른 계층으로 설계해야 했다면 Astra가 지향하는 구조는 하나의 고성능 모델이 여러 도구를 오케스트레이션하면서 긴 업무 흐름을 책임지는 방식에 한층 가까워졌다.
경쟁의 기준은 이제 ‘누가 더 좋은 답을 쓰느냐’가 아니다
이번 출시가 보여주는 더 큰 변화는 AI 시장의 경쟁축이 “누가 더 좋은 답을 쓰느냐”에서 “누가 실제 일을 끝까지 수행하느냐”로 이동하고 있다는 사실이다.
GPT 계열을 비롯한 생성형 AI의 성능을 설명하는 대표적인 장면은 지금까지 질문에 답하거나 글과 코드를 만들어내는 것이었다. Astra가 전면에 내세운 장면은 다르다. 웹을 탐색하고, 소프트웨어를 조작하고, 자료를 분석하고, 산출물을 만들고, 결과를 다시 확인하는 일련의 작업이다. 모델 자체가 하나의 지식 엔진이라기보다 디지털 업무 환경에서 행동하는 실행 주체에 가까워지고 있다.
그렇다고 인간의 업무가 곧바로 대체된다고 결론내리는 것도 성급하다. 높은 벤치마크 점수와 안정적인 실제 운영은 다른 문제이며, 특히 기업 업무에서는 데이터 접근권한, 승인 절차, 오류 책임, 보안, 규제 준수 같은 요소가 모델 지능만큼 중요하다.
오픈AI가 Astra에 행동 감시와 추가 안전 점검을 적용하고, 잠재적으로 허가되지 않은 행동이 감지되면 작업이 일시 중단되거나 사용자 검토를 요구할 수 있도록 설계한 것도 이 문제와 연결된다. 강력한 에이전트일수록 더 많은 일을 할 수 있지만 잘못된 행동 한 번의 비용 역시 커질 수 있다.
결국 GPT-6 Astra의 의미는 “가장 똑똑한 AI가 나왔다”는 한 문장보다 훨씬 크다. 오픈AI가 이번 세대에서 밀어붙이는 방향은 추론 능력과 컴퓨터 사용, 장문맥, 코딩, 문서 제작, 도구 호출을 하나의 작업 흐름으로 결합해 사람이 지시한 목표를 실제 결과물로 바꾸는 것이다.
일부 벤치마크에서는 경쟁 모델이 여전히 앞서고 가격도 GPT-5.6 Sol보다 높다. 그럼에도 자동화와 컴퓨터 사용에서 나타난 큰 성능 상승은 기업이 AI를 평가하는 기준 자체를 바꿀 가능성이 있다.
앞으로 중요한 질문은 “Astra가 인간보다 똑똑한가”가 아니라 “기업이 맡긴 업무를 어느 정도의 감독으로, 얼마나 자주 정확하게 끝낼 수 있는가”가 될 것이다. 그 답이 충분히 높은 수준에 도달한다면 생성형 AI는 사무직을 돕는 보조도구에서 기업의 실제 업무 흐름을 수행하는 디지털 노동 인프라로 이동한다. GPT-6 Astra는 그 전환이 더 이상 먼 미래의 개념만은 아니라는 점을 보여주는 모델이다.

![미국의 한 직장인이 OpenAI의 차세대 AI 모델 ‘GPT-6 Astra’를 업무에 활용하는 모습. GPT-6 Astra는 컴퓨터 사용·코딩·장문맥·업무자동화 능력을 강화하며 AI 에이전트 경쟁의 전환점으로 주목받고 있다. [사진 = KBR 자료사진]](/_next/image?url=https%3A%2F%2Fepzvqcvbpcduaglyoici.supabase.co%2Fstorage%2Fv1%2Fobject%2Fpublic%2Fnews-images%2Farticles%2F2026%2F09%2F09%2F1788914399650-57730a12-b3e5-475f-b8cb-4244c7599e50.jpg&w=1200&q=75)