Create · 칼럼
DeepSeek가 바꿀 AI와 세무 업무의 미래
제가 다른 건 몰라도 꼭 챙겨보는 것이 두 가지 있습니다.하나는 앤트로픽 공식 문서이고, 다른 하나는 DeepSeek의 기술 보고서(tech report)입니다.어제 DeepSeek가 V4.1 Flash 모델을 발표하면서 기술 보고서까지 공개했는데, 내용이 꽤 충격적이라 한 번 정리해 공유합니다.
요즘 AI 업계의 시선은 온통 초대형 모델에 쏠려 있습니다.블랙웰 GPU 10만 대를 미국 텍사스에서 몇 달씩 돌려 파라미터 규모를 키우고, 컴퓨터를 직접 다루는 능력까지 끌어올린 모델이 이번에 나온 GPT-6 Astra입니다.성능은 놀랍습니다.다만 치명적인 문제가 하나 있습니다.토큰을 너무 많이 씁니다.
AI가 질문에 한 번 답하는 수준을 넘어 몇 시간 동안 자료를 읽고, 도구를 쓰고, 중간 결과를 기억하며 실제 업무를 수행하기 시작하면 비용 문제는 더 커집니다.Astra처럼 컴퓨터 사용 능력을 극한까지 끌어올린 모델일수록 그렇습니다.최고 성능의 모델을 만들 수 있느냐만큼, 그 모델을 얼마나 싸고 오래 운영할 수 있느냐가 중요해지는 이유입니다.이런 시점에 DeepSeek가 공개한 기술 보고서는 꽤 골때리는 해법을 제시했습니다.
1. KV Cache가 뭔데 그렇게 중요한가?
LLM은 답변을 만들 때 앞서 읽은 대화를 매번 처음부터 다시 계산하지 않습니다.한 번 읽은 내용을 바탕으로 만든 중간 계산 결과를 저장해 두고, 다음 토큰을 생성할 때 재사용합니다.이 중간 기억이 KV Cache입니다.사람에 비유하면 원본 문서는 책장에 꽂힌 자료, 모델 파라미터는 지식을 처리하는 뇌, KV Cache는 지금 책상 위에 펼쳐 놓은 작업 메모입니다.
짧은 대화에서는 별문제가 되지 않습니다.하지만 AI 에이전트가 몇 시간 동안 코드를 읽고, 수정하고, 테스트하고, 오류 로그를 확인하고, 웹을 검색하고, 문서를 읽고, 다시 수정하고, 사용자와 대화하고, 다음 작업으로 넘어가는 일을 반복한다고 생각해 보겠습니다.작업 기록이 계속 쌓이면 AI가 기억해야 할 문맥도 수십만, 수백만 토큰으로 길어지고, KV Cache 역시 크게 늘어납니다.
DeepSeek는 이 문제를 장기 실행형 AI 에이전트의 핵심 병목으로 봅니다.긴 컨텍스트 환경에서는 GPU의 HBM 용량뿐 아니라 SSD와 호스트 메모리의 저장 공간, 캐시를 옮기는 데이터 전송 대역폭까지 부담이 되기 때문입니다.따라서 앞으로는 단순히 "모델이 얼마나 똑똑한가?"만 물어서는 부족합니다.그 똑똑한 모델을 얼마나 싸게, 오래, 반복해서 일하게 만들 수 있는가.이 질문이 점점 더 중요해지고 있습니다.
2. DeepSeek-V4.1-Flash는 무엇을 바꿨나?
DeepSeek-V4.1-Flash는 최대 100만 토큰(1M tokens)의 컨텍스트를 지원하는 멀티모달 MoE 모델입니다.백본 파라미터는 552B로 상당히 크지만, 토큰 하나를 처리할 때 모든 파라미터를 쓰는 것은 아닙니다.입력을 읽는 prefill 단계에서는 토큰당 약 8B, 답을 생성하는 decode 단계에서는 토큰당 약 16B 파라미터만 활성화됩니다.
핵심은 모델을 무작정 작게 만든 것이 아니라, 필요한 계산과 기억만 선택적으로 사용하도록 전체 시스템을 설계했다는 점입니다.이를 가능하게 만든 주요 기술은 네 가지입니다.
- CED: 긴 입력을 읽는 계산량 축소
- CSA2: 계층 간 KV Cache 공유
- FP4: KV Cache를 더 낮은 정밀도로 저장
- SWA Bounded Replay: 오래된 캐시를 모두 저장하지 않고 필요한 부분만 재계산
하나씩 살펴보겠습니다.
3. CED: 긴 입력을 읽는 비용을 거의 절반으로
LLM의 작업은 크게 두 단계로 나뉩니다.사용자가 입력한 문서, 코드, 대화 기록을 처음 읽는 prefill 단계와, 읽은 내용을 바탕으로 답변을 한 토큰씩 생성하는 decode 단계입니다.AI 에이전트 시대에는 의외로 prefill 비용이 매우 중요합니다.에이전트가 도구를 쓸 때마다 새로운 로그, 파일, 검색 결과와 코드가 컨텍스트에 계속 들어오기 때문입니다.
DeepSeek는 이 비용을 줄이기 위해 CED(Causal Encoder-Decoder) 구조를 썼습니다.40개의 Transformer 층이 있다고 하면 기존 구조는 입력이 1층부터 40층까지 차례로 지나갑니다.CED는 이를 Encoder 20층과 Decoder 20층, 두 부분으로 나눕니다.긴 입력을 읽을 때 Decoder 쪽의 전역 KV를 Encoder 결과에서 효율적으로 만들어 내는 방식입니다.보고서는 긴 시퀀스의 prefill 계산량을 거의 절반 수준으로 낮출 수 있다고 설명합니다.
이 구조가 특히 의미 있는 이유는 에이전트 업무가 대부분 입력을 많이 읽는 업무이기 때문입니다.
4. CSA2: 모든 층이 자기 메모를 굳이 따로 가질 필요가 있는가?
기존 Transformer를 아주 단순하게 표현하면 각 층이 내용을 읽고 자신의 KV를 따로 저장하는 구조입니다.1층도, 2층도, 3층도, 4층도 각자 읽고 각자 저장합니다.DeepSeek는 여기에서 한 가지 질문을 던집니다."정말 모든 층이 자신만의 KV Cache를 따로 가지고 있어야 할까?" 그 결과 나온 구조가 CSA2(Compressed Sparse Attention 2)입니다.
CSA2에는 세 가지 작동 방식이 있습니다.
- Full Mode: KV를 새로 만들고, 어떤 과거 토큰을 볼지도 새로 찾습니다.
- Reindex Mode: KV는 이전 층의 것을 재사용하되, 중요한 토큰은 다시 찾습니다.
- Reuse Mode: KV와 이전 층이 찾은 중요 위치를 모두 재사용합니다.
즉, 모든 층이 처음부터 같은 계산을 반복하지 않습니다.공유할 수 있는 정보는 공유하고, 꼭 필요한 층에서만 새로 계산합니다.이렇게 하면 KV Cache의 크기뿐 아니라 긴 문맥에서 어디를 봐야 하는지 찾는 계산 비용도 줄어듭니다.
5. FP4: 기억을 더 작은 숫자로 저장하기
FP4는 비교적 직관적인 아이디어입니다.어떤 숫자를 저장할 때 언제나 매우 높은 정밀도가 필요한 것은 아닙니다.예를 들어 1,238,742,382.192748…이라는 값을 용도에 따라 "약 12.39억"으로 저장해도 충분할 수 있습니다.DeepSeek는 비슷한 발상을 KV Cache에 적용해, main KV Cache를 기존보다 훨씬 낮은 정밀도인 FP4 수준으로 양자화했습니다.
보고서에 따르면 이 방식은 FP8 기반 main KV Cache와 비교해 저장 용량을 거의 절반으로 줄이면서도 성능 저하는 매우 제한적이었습니다.여기에 CSA2의 계층 간 공유를 결합한 결과, DeepSeek-V4.1-Flash의 global KV Cache는 토큰당 약 890바이트까지 줄었습니다.DeepSeek-V4-Flash 대비 약 4분의 1 수준입니다.
6. SWA Bounded Replay: 모든 기억을 보관하지 않아도 된다
개인적으로 이번 보고서에서 가장 흥미롭게 본 아이디어 중 하나입니다.6개월짜리 프로젝트를 진행하다 최근 작업 메모 일부를 잃어버렸다고 가정해 보겠습니다.기존 방식은 정확한 상태를 복원하기 위해 상당 부분을 다시 계산하는 것에 가깝습니다.DeepSeek의 접근은 다릅니다."전체 핵심 정보는 이미 저장되어 있으니, 최근 구간만 다시 계산해도 충분하지 않을까?" 이것이 SWA Bounded Replay입니다.
Sliding Window Attention은 가까운 과거를 중심으로 봅니다.이 특성을 이용해 모든 SWA 상태를 SSD에 장기간 보관하는 대신, 캐시가 없을 때 최근 window만 다시 재생(replay)합니다.수학적으로 완전히 동일한 상태를 복원하는 것은 아닙니다.그럼에도 DeepSeek의 실험에서는 실제 응답 품질의 저하가 거의 없었습니다.이 전략으로 SSD나 호스트 메모리에 오래 보관해야 하는 persistent KV Cache를 DeepSeek-V4-Flash 대비 약 8분의 1 수준으로 줄였습니다.단순한 모델 구조 개선을 넘어선 시스템 엔지니어링 최적화입니다.
7. 알고리즘보다 파이프라인
보고서 후반부에는 DeepSeek가 에이전트를 어떻게 학습시키는지가 상당히 자세하게 나옵니다.흥미로운 점은 이번 post-training에서 새로운 강화학습 알고리즘을 발명한 것이 아니라고 스스로 밝힌다는 사실입니다.기본 흐름은 SFT, 강화학습, On-Policy Distillation으로 기존과 비슷합니다.그런데 실제 성능 향상에서 더 중요했던 것은 알고리즘 자체보다 데이터와 환경을 만드는 파이프라인이었다고 설명합니다.
현재 단계에서는 새로운 post-training 알고리즘을 만드는 것보다, 더 좋은 데이터와 학습 환경을 설계하는 쪽의 한계효용이 더 크다는 이야기입니다.이 주장은 앞으로 AI 비즈니스를 생각할 때 상당히 중요합니다.
8. AI의 학습 데이터가 문서에서 업무 경험으로 이동합니다
과거 LLM의 학습은 좋은 책, 웹 문서, 코드, 논문을 대량으로 학습해 더 똑똑한 모델을 만드는 과정이었습니다.Agent 시대에는 여기에 새로운 과정이 더해집니다.실제 업무 환경에서 AI가 직접 업무를 수행하고, 성공과 실패를 자동으로 측정하고, 실패 원인을 분석하고, 변형 업무를 만들어 다시 수행하고, 강화학습으로 이어지는 순환입니다.업무 경험 자체가 학습 데이터가 되는 구조입니다.
DeepSeek는 일반 에이전트 학습을 위해 SaaS, 기업용 소프트웨어와 백엔드 시스템의 인터페이스를 흉내 낸 mock tool을 만들고, 실제 사용자 업무에서 나온 실패 사례를 재현합니다.Coding Agent의 학습 환경은 더 체계적입니다.여러 에이전트가 역할을 나눕니다.
- Agent A: GitHub 프로젝트가 실행 가능한지 확인
- Agent B: 적절한 개발 과제 생성
- Agent C: 테스트와 검증 포인트 생성
- Agent D: 실제 문제 해결 시도
- Agent E: 과제나 평가 방식의 오류 검사
- Agent F: 너무 쉽거나 어려운 문제 조정
이렇게 만든 환경에서 모델이 과제를 반복 수행하고, 결과를 검증받으며 학습합니다.결국 앞으로 중요한 자산은 단순한 문서 데이터베이스가 아니라 AI가 실제 업무를 연습할 수 있는 환경과 자동 채점 시스템이 될 가능성이 큽니다.
9. Reasoning Effort: 같은 모델도 생각의 깊이를 조절할 수 있습니다
이번 보고서에는 Reasoning Effort라는 기능도 등장합니다.모델에 1부터 100까지의 수치를 주어 얼마나 많은 추론 자원을 쓸지 조절하는 방식입니다.25는 빠르고 저렴하게, 50은 균형 있게, 75는 더 깊게 검토, 100은 비용을 더 쓰더라도 최대한 철저하게.낮은 effort에서는 긴 추론에 더 강한 페널티를 주고, 높은 effort에서는 더 긴 탐색과 검증을 허용합니다.하나의 모델로 빠르고 저렴한 모드부터 느리지만 강한 모드까지 조절할 수 있는 셈입니다.
보고서에서는 effort를 25에서 100으로 높였을 때 여러 reasoning benchmark의 평균 Pass@1이 67.1%에서 76.3%로 올랐다고 설명합니다.DeepSWE v1.1도 66.0%에서 74.2%로 올랐습니다.대신 출력 토큰은 약 2.5배 늘어납니다.중요한 것은 비용 대비 효과입니다.분석 결과 대체로 60~80 구간에서 최대 성능의 상당 부분을 확보하고, 100에 가까워질수록 추가 비용 대비 성능 향상은 작아지는 경향이 나타났습니다.
실제 서비스에서는 단순 추출·분류 업무는 Low, 일반적인 분석은 High, 중요한 의사결정과 고난도 문제는 Max처럼 업무 난이도에 따라 추론 비용을 배분할 수 있습니다.Reasoning Effort는 단순한 성능 설정이 아니라 AI 서비스의 원가관리 장치가 될 수 있습니다.
10. Multi-Agent는 실제로 효과가 있었나?
DeepSeek는 하나의 에이전트가 모든 일을 처리하는 방식과 여러 에이전트가 협업하는 방식을 비교했습니다.Lead Agent가 일을 나누고, Agent A부터 D까지가 병렬로 작업한 뒤 결과를 다시 합치는 구조입니다.흥미로운 점은 에이전트 수만 늘린 것이 아니라 협업 방식 자체도 강화학습으로 훈련했다는 것입니다.보상에는 실제 업무 성능뿐 아니라 적절한 위임, 에이전트 간 커뮤니케이션, 전체 처리 지연시간까지 포함했습니다.
아직 예비 결과(preliminary result)이지만, 테스트한 모든 wall-clock deadline에서 Multi-Agent가 Single-Agent보다 좋은 결과를 보였습니다.ProgramBench 최고 지점은 20.39%에서 30.04%로, FrontierSWE v2 최고 지점은 28.20%에서 32.90%로 올랐습니다.복잡한 지식노동을 하나의 거대한 에이전트가 모두 처리하기보다, 여러 전문 에이전트가 역할을 나누는 구조가 충분히 현실적인 방향임을 보여줍니다.
11. 성능은?
DeepSeek가 보고서에서 제시한 자체 평가 결과를 보면 V4.1-Flash는 일부 에이전트 벤치마크에서 최고급 폐쇄형 모델과 비슷하거나 더 높은 수치를 기록했습니다.GPT-5.6 Sol과 비교하면 Terminal-Bench 2.1은 88.8 대 90.6, DeepSWE v1.1은 73.0 대 74.2, CyberGym은 84.5 대 88.1, Automation-Bench는 45.8 대 54.8입니다.가격표를 단순 비교하면 Claude Opus 5 대비 약 20분의 1 수준이라는 점도 눈에 띕니다.일부 작업에서는 속도까지 더 나은 모습을 보였다는 것이 제가 특히 충격적으로 느낀 대목입니다.
다만 더 어려운 문제에서는 여전히 차이가 있습니다.Terminal-Bench 4.0에서는 Opus-5가 51.8, GPT-5.6 Sol이 39.9, DeepSeek-V4.1-Flash가 31.2입니다.DeepSeek 역시 보고서 마지막에서 벤치마크 점수가 비슷하다고 해서 복잡한 고난도 추론과 예외 상황 대응 능력까지 최고 수준의 폐쇄형 모델과 완전히 동등하다는 뜻은 아니라고 경고합니다.따라서 이 결과는 모든 면에서 더 뛰어나다기보다, 훨씬 낮은 운영비로 상당수 에이전트 업무에서 경쟁력 있는 성능을 낸다는 의미로 해석하는 편이 적절합니다.
12. 세무 업무에는 어떻게 적용할 수 있을까?
이 보고서를 세무·회계 AI의 관점에서 보면 몇 가지 실질적인 시사점이 보입니다.
① 최고의 모델보다 "한 고객의 업무를 얼마에 유지하는가"가 중요해집니다
DeepSeek가 줄이려 한 것은 단순한 모델 크기가 아니라 KV Cache, prefill, 저장 및 전송 비용입니다.V4.1-Flash는 global KV를 이전 모델의 약 4분의 1, persistent KV를 약 8분의 1 수준으로 줄였습니다.세무 AI 서비스를 만든다면 "GPT냐, Claude냐, DeepSeek냐"만 비교할 것이 아니라, 고객 한 명의 장기 업무 컨텍스트를 얼마의 비용으로 유지할 수 있는가를 핵심 원가 지표로 봐야 합니다.
② "많이 읽고 적게 쓰는" 세무 업무는 CED의 직접적인 수혜 영역입니다
세무 업무는 최종 답변보다 입력 자료가 압도적으로 많습니다.총계정원장, 계약서, 세금계산서, 신고서, 예규와 과거 검토보고서를 모두 읽고 결과는 몇 페이지로 정리하는 경우가 많습니다.CED는 이런 input-heavy workload의 prefill 계산량을 줄이는 구조입니다.따라서 세무·법무·감사처럼 많이 읽고 비교적 적게 쓰는 전문직 업무가 AI 운영비 하락의 직접적인 수혜자가 될 수 있습니다.
③ 1M context는 업무 단위 전체를 기억하게 할 수 있습니다
100만 토큰 컨텍스트가 실용화되면 고객 기본정보, 전기 신고서, 총계정원장, 주요 계약서, 질의응답 기록, 지금까지의 작업 로그를 하나의 업무 기억, 하나의 Engagement Memory처럼 유지하는 설계가 가능해집니다.
물론 1M context가 가능하다고 모든 자료를 무조건 넣는 것이 좋은 것은 아닙니다.그래도 문서를 잘게 나눠 검색하는 기존 RAG 중심 설계보다 제품의 선택지가 크게 넓어집니다.
④ 업무 난이도별로 추론 비용을 자동 배분할 수 있습니다
Reasoning Effort를 적용하면 업무별로 비용과 정확도의 균형을 조절할 수 있습니다.증빙 분류와 OCR은 낮은 비용으로, 계정 검토는 중간 수준으로, 쟁점 세법 판단과 세무조사 대응은 가장 높은 effort로.모든 업무에 최고급 추론을 쓰는 대신, 위험과 난이도에 맞게 비용을 배분하는 방식입니다.
⑤ 가장 중요한 자산은 세법 데이터보다 세무 업무 환경일 수 있습니다
국세청 예규를 많이 모으는 것도 중요합니다.그러나 그 못지않게 중요한 것은 훈련 환경입니다.가상 회사를 만들고, 장부와 증빙을 주고, AI가 신고 업무를 수행하게 하고, 정답 세무조정과 비교해 자동으로 채점하고, 오류 원인을 분석하고, 변형 문제를 만드는 순환.저는 이것을 Tax Task Factory라고 부를 수 있다고 봅니다.
예를 들어 하나의 에이전트 과제를 이렇게 구성할 수 있습니다.문제는 접대비 세무조정, 환경은 회사 원장과 카드 내역과 계정명세서, 검증기는 정답 손금불산입액과 소득처분.이런 문제를 수만 개 만들고 자동으로 난이도와 정확성을 검증할 수 있다면 단순한 프롬프트 모음보다 훨씬 강력한 사업 자산이 됩니다.
⑥ AI의 실패 사례가 가장 가치 있는 데이터가 됩니다
실제 업무에서 AI가 틀린 사례를 버리면 안 됩니다.AI가 틀린 세무조정을 전문가가 수정하고, 오류 원인을 태깅하고, 같은 유형의 변형 문제를 만들고, 회귀 테스트를 거쳐 재학습하는 과정이 자동으로 돌아가면, 시간이 지날수록 경쟁사가 돈을 주고도 쉽게 살 수 없는 고유한 업무 데이터셋이 쌓입니다.
⑦ 모델보다 Harness를 소유하는 전략이 중요해집니다
DeepSeek는 같은 모델을 Claude Code, Codex, OpenCode, Pi, mini-SWE, DeepSeek Harness 등 여러 실행 환경에서 시험했습니다.실제 성능은 어떤 하네스를 쓰느냐에 따라 달라지기도 합니다.따라서 장기적으로는 특정 모델에 종속된 "Claude용 세무 앱"보다, 우리의 Tax Harness 위에 필요에 따라 Claude, GPT, DeepSeek를 바꿔 끼우는 구조가 더 강할 수 있습니다.
세무 업무라면 Lead 세무사 Agent 아래에 법인세, 부가가치세, 세법 검색, 회계 검증, 최종 리뷰 에이전트를 둘 수도 있습니다.다만 에이전트 수를 늘리는 것보다 누가 무엇을 맡고, 결과를 어떤 기준으로 검증할 것인지를 설계하는 일이 더 중요합니다.
13. 결국 결론은
제가 이 보고서를 읽고 내린 결론은, 장기적으로 만들 가치가 있는 것이 클로드 코드나 코덱스로 만든 세무 딸깍봇 정도가 아니라 Tax Agent Operating System에 가깝다는 것입니다.필요한 구성요소를 정리하면 다음과 같습니다.
- 모델 라우터
- 장기 컨텍스트와 KV 관리
- 세무 Tool 및 API
- Tax Harness
- 업무 시뮬레이터
- 자동 Evaluator
- 실패 사례 데이터베이스
- Reasoning Cost Router
- Multi-Agent orchestration
- Audit Log
이는 보고서의 직접적인 표현이 아니라, 기술과 실험 결과를 세무 업무에 대입해 제가 확장한 해석입니다.DeepSeek 역시 장기적으로 모델과 하네스를 함께 최적화하는 model–harness co-design을 향후 방향으로 제시합니다.
마치며: 경쟁의 기준이 달라지고 있습니다
표면적으로 이 보고서는 KV Cache 압축 기술에 관한 보고서입니다.하지만 조금 더 크게 보면 AI 산업의 경쟁 기준이 어떻게 바뀌고 있는지를 보여줍니다.과거의 AI 경쟁은 큰 모델과 많은 GPU로 더 높은 벤치마크를 얻는 싸움이었습니다.Agent 시대의 AI 경쟁은 긴 Context와 Tool 사용, 장시간 반복 업무에서 비용과 인프라가 병목이 되고, CED·CSA2·FP4·Bounded Replay와 Reasoning Effort, 업무 환경, Multi-Agent를 거쳐 싸고 오래 일하는 AI로 향합니다.
앞으로의 경쟁은 "누가 더 큰 모델을 만드는가?"에서 "비슷한 지능을 얼마나 싸고, 오래, 안정적으로 실제 업무에 투입할 수 있는가?"로 옮겨 갈 가능성이 큽니다.그리고 특정 산업에서 진짜 경쟁력을 만드는 요소는 모델 하나가 아닐 것입니다.Model, Context, Tools, Harness, Environment, Evaluator.이 전체 시스템을 얼마나 잘 설계하고, 실제 실패를 통해 얼마나 빠르게 개선할 수 있느냐가 핵심입니다.
세무 분야도 마찬가지입니다.법과 예규를 많이 알고 있는 챗봇을 넘어, 실제 장부를 읽고, 업무를 수행하고, 결과를 검증받고, 실패에서 다시 학습하는 시스템을 만들어야 합니다.