양자 시뮬레이션의 벤치마킹과 정확성 검증 방법
Quantum Simulator Benchmarking and Validation
목차 (8개 섹션)
2019년 10월, 구글이 시커모어 프로세서로 "양자 우월성"을 달성했다고 발표했을 때 가장 먼저 나온 질문은 "정말인지 어떻게 증명하나"였다. 53큐비트짜리 칩이 200초 만에 풀었다는 무작위 회로 표집 문제를, 당시 세계 최고 슈퍼컴퓨터 서밋으로는 1만 년이 걸린다고 구글은 주장했다. IBM은 곧바로 반박 논문을 내고 적절한 디스크 활용과 알고리즘 최적화를 하면 2.5일이면 충분하다고 계산했다. 이 논쟁 자체가 양자 시뮬레이션 벤치마킹이라는 분야의 핵심을 보여준다 — 결과가 맞는지 확인할 방법이 마땅치 않은 영역에서 신뢰를 어떻게 만드느냐는 문제다.
양자컴퓨터의 골치 아픈 지점은, 큐비트 수가 늘어날수록 그 상태를 고전 컴퓨터로 검증하기가 기하급수적으로 어려워진다는 것이다. 50큐비트의 순수 상태를 완전히 기술하려면 2^50, 약 1000조 개의 복소수 진폭이 필요하다. 그러니 "이 답이 맞다"를 확인하려는 순간 애초에 양자컴퓨터를 쓴 이유가 사라진다. 그래서 연구자들은 직접 정답을 확인하는 대신 간접적인 증거를 쌓는 방법을 발전시켰다.
가장 널리 쓰이는 도구가 무작위 벤치마킹(randomized benchmarking, RB)이다. 2005년 이매뉴얼 노프와 조지프 에머슨이 제안한 이 방법은, 무작위로 고른 게이트를 잔뜩 실행한 뒤 마지막에 원래 상태로 되돌리는 게이트를 붙여서, 이론상 100% 확률로 초기 상태가 나와야 하는 실험을 반복한다. 실제 성공률이 이론치에서 벗어나는 정도를 측정하면 게이트당 평균 오류율을 뽑아낼 수 있다. IBM, 구글, IonQ 같은 회사들이 자사 칩의 "게이트 충실도 99.9%" 같은 수치를 발표할 때 대개 이 방법이 깔려 있다.
교차 엔트로피 벤치마킹(cross-entropy benchmarking, XEB)은 구글이 시커모어 실험에서 실제로 사용한 방법이다. 무작위 양자 회로를 여러 번 반복 실행해 얻은 출력 분포를 이론적으로 예측되는 분포와 비교하는 방식인데, 여기서 나온 지표가 이른바 선형 XEB 정확도다. 문제는 이 지표 해석을 둘러싸고 학계가 갈렸다는 점이다. 2022년 중국 과학기술대 연구팀은 텐서 네트워크 축약 기법으로 시커모어 결과를 15시간 만에 재현했다고 발표했고, 이후에도 여러 그룹이 고전 알고리즘 개선으로 "우월성 격차"를 계속 좁혀왔다. 즉 벤치마크 수치 자체는 견고해도, 그 수치가 "고전으로는 불가능"을 의미하는지는 계속 움직이는 목표물이다.
또 다른 축은 양자 볼륨(quantum volume)이다. IBM이 2017년 제안한 이 지표는 큐비트 수만 세는 대신, 실제로 오류 없이 실행 가능한 회로의 폭과 깊이를 함께 고려한 종합 점수다. 2020년 IBM 27큐비트 칩이 양자 볼륨 64를 기록했고, 2022년에는 IonQ가 트랩 이온 방식으로 양자 볼륨 4백만 이상을 주장하며 논쟁을 낳기도 했다. 측정 방법론이 하드웨어마다 미묘하게 달라서 회사 간 수치를 그대로 비교하기 어렵다는 비판이 꾸준히 나온다.
정확성 검증 쪽에서는 양자 상태 단층촬영(state tomography)과 게이트 세트 단층촬영(gate set tomography, GST)이 좀 더 엄밀한 도구로 쓰인다. 다만 이 방법들은 큐비트 수가 늘면 필요한 측정 횟수가 지수적으로 폭증해 5~7큐비트를 넘으면 사실상 비현실적이다. 그래서 최근에는 섀도 단층촬영(classical shadows, 2020년 화이트 등이 제안)처럼 측정 횟수를 다항식 규모로 줄이는 기법이 주목받고 있다. NIST와 여러 대학 연구소가 이 방법을 표준화하려는 초기 논의를 진행 중이다.
결국 이 분야가 마주한 근본 딜레마는, 검증 도구 자체가 발전할수록 "양자 우월성"의 기준선도 함께 움직인다는 점이다. 고전 알고리즘과 하드웨어가 개선되면 어제의 우월성 주장은 오늘의 평범한 계산으로 밀려난다. 그래서 요즘 학계에서는 "우월성 달성"이라는 일회성 선언보다, 실용적 오류 정정과 반복 가능한 벤치마크 스위트를 함께 보고하는 쪽으로 관행이 옮겨가고 있다.
주요 벤치마킹 및 검증 기법의 원리
무작위 벤치마킹
무작위 벤치마킹(RB)은 무작위 게이트 연산을 반복 실행하여 게이트 단위의 평균 오류율을 산출하는 성능 측정 도구다. 이 기법은 양자 하드웨어 제조사가 칩의 게이트 충실도를 검증하고 발표할 때 주로 쓰인다.무작위 벤치마킹의 작동 순서는 다음과 같다. 1. 양자 프로세서에 무작위로 선택된 게이트 연산을 순차적으로 실행한다. 2. 실행된 연산의 마지막 단계에 전체 상태를 초기 상태로 되돌리는 복원 게이트를 추가하여 적용한다. 3. 이론상 100% 확률로 초기 상태가 출력되어야 하는 실험을 반복 실행한다. 4. 실제 측정된 성공률이 이론적 수치에서 벗어난 오차를 측정하여 게이트당 평균 오류율을 계산한다.
무작위 벤치마킹은 직접 검증이 어려운 양자 프로세서의 게이트 충실도를 정량적으로 측정할 수 있게 돕는다. 다만 측정된 수치는 반복 실험을 통해 도출한 통계적 평균값이라는 조건이 따르며, 개별 게이트의 구체적인 오류 원인을 모두 직접 식별하는 방식은 아니다.
교차 엔트로피 벤치마킹
교차 엔트로피 벤치마킹(XEB)은 양자 회로의 출력 확률 분포를 고전 이론적 예측 분포와 비교하여 정확도를 평가하는 기법이다. 이 기법은 무작위 회로 표집 문제를 수행하는 양자 프로세서의 동작 정확도를 측정하는 데 쓰인다.교차 엔트로피 벤치마킹의 작동 원리는 다음과 같다. 1. 무작위 양자 회로를 양자 프로세서에서 여러 번 반복 실행한다. 2. 반복 연산의 결과로 도출된 양자 프로세서의 출력 분포 데이터를 수집한다. 3. 이론적으로 예측되는 출력 분포와 실제 수집된 출력 분포를 대조하여 일치도를 계산한다. 4. 계산된 일치도를 바탕으로 선형 교차 엔트로피 벤치마킹 정확도 지표를 도출한다.
교차 엔트로피 벤치마킹을 적용하면 특정 무작위 회로 표집 연산의 정확도를 지표로 나타낼 수 있다. 다만 교차 엔트로피 벤치마킹 수치가 고전 계산 불가능성을 보장하는지에 대해서는 학계의 해석이 엇갈리고 있으며, 고전 알고리즘과 하드웨어 계산 방식이 개선되면 해당 수치가 의미하는 격차가 좁혀질 수 있다는 한계가 존재한다.
양자 볼륨
양자 볼륨은 큐비트 수와 함께 오류 없이 실행 가능한 회로 깊이를 종합하여 프로세서의 연산 용량을 평가하는 지표다. 이 지표는 큐비트 개수만을 세는 단순 비교를 보완하고 프로세서의 실제 연산 성능을 종합 점수로 산출하는 데 쓰인다.양자 볼륨의 평가 절차는 다음과 같다. 1. 양자 프로세서의 가용 큐비트 수로 회로의 폭을 설정한다. 2. 프로세서가 오류 없이 연속으로 실행할 수 있는 게이트 연산 단계의 수를 회로의 깊이로 측정한다. 3. 유효 회로의 폭과 깊이를 종합하여 안정적인 연산이 가능한 영역을 계산한다. 4. 계산된 연산 한계를 단일 지표인 양자 볼륨 수치로 환산한다.
양자 볼륨은 프로세서의 회로 규모와 오류 수준을 복합적으로 파악할 수 있는 지표로 활용된다. 그러나 측정 방법론이 하드웨어 종류에 따라 미묘하게 차이를 보이기 때문에 제조사 간 수치를 직접 비교하기 어렵다는 비판이 제기된다.
단층촬영 기법
단층촬영 기법은 양자 시스템의 상태와 연산 단계를 정밀하게 재구성하여 오차를 측정하는 검증 도구다. 이 기법은 소규모 양자 시스템의 상태와 게이트 동작을 엄밀하게 검증하는 데 쓰인다.단층촬영 기법의 작동 방식과 세부 분류는 다음과 같다.
- 양자 상태 단층촬영: 양자 시스템의 물리적 상태를 직접 측정하여 전체 밀도 행렬을 재구성한다.
- 게이트 세트 단층촬영(GST): 양자 프로세서에서 작동하는 게이트 세트 전체를 정밀하게 측정하여 게이트 동작의 오차를 검증한다.
- 섀도 단층촬영: 측정 횟수를 다항식 규모로 축소하여 양자 상태의 특성을 고전적으로 재구성한다.
- 슈퍼컴퓨터의 디스크 활용 최적화와 알고리즘 개선은 양자 연산 재현에 소요되는 계산 시간을 대폭 줄인다.
- 텐서 네트워크 축약 기법과 같은 고전 연산 기법의 발전은 기존 양자 칩의 연산 결과를 단시간 내에 재현하여 우월성 격차를 축소한다.
양자 상태 단층촬영과 게이트 세트 단층촬영은 높은 정밀도로 시스템을 검증하는 효과가 있다. 그러나 큐비트 수가 늘어나면 필요한 측정 횟수가 지수적으로 증가하므로 5개에서 7개 큐비트를 초과하는 시스템에는 적용하기 어렵다는 한계가 있다. 섀도 단층촬영은 측정 규모를 다항식 수준으로 줄여 대규모 확장을 도모하지만, 표준화 논의는 초기 단계에 머물러 있는 것으로 알려졌다.
검증의 기술적 한계 및 기준선의 변화
고전 검증의 연산 자원 제약
양자 큐비트 수가 증가함에 따라 고전 컴퓨터를 통한 상태 검증은 기하급수적인 연산 자원을 요구한다. 50큐비트의 순수 상태를 완전히 기술하려면 약 1000조 개(2^50)의 복소수 진폭을 계산해야 하므로 고전 컴퓨터로 완전한 정답을 직접 확인하는 것은 현실적으로 어렵다. 따라서 연구자들은 직접 검증 대신 통계적 표집과 복원 실험을 통한 간접 증거 수집 방식을 사용한다.우월성 기준선의 유동성과 검증 관행의 전환
양자 우월성 기준선은 고전 알고리즘과 슈퍼컴퓨팅 기술의 발전에 따라 계속 변화한다.이와 같이 검증 기준선이 유동적으로 변함에 따라 학계의 보고 관행도 전환되는 흐름을 보인다. 일회성 우월성 달성 선언에 의존하기보다, 실용적인 오류 정정 기술과 반복 검증이 가능한 벤치마크 스위트를 병행하여 보고하는 방향으로 관행이 옮겨가는 것으로 분석된다.
문서 정보
- 최초 작성
- 최종 갱신
- 분류
- 과학
HANGUL.WIKI가 정리·작성한 문서입니다. 정확성을 위해 노력하나 오류가 있을 수 있으므로, 중요한 내용은 공식 출처를 통해 확인하시기 바랍니다. 내용의 오류나 정정 요청은 오류·정정 신고로 알려주시면 검토 후 반영합니다.