모든 언어
공유
아침 Palo Alto에서 커피가 제공되자마자 Alan Walker는 Anthropic의 하네스 기사를 내려다보더니 단 한 문장만 말했습니다.
"많은 사람들이 이것이 모델의 또 다른 진전이라고 생각합니다. 이는 틀렸습니다. 이것은 사람을 배신하는 과정의 시작입니다."
이 기사에서는 엔지니어링 설계, 기획자, 생성자, 평가자에 대해 설명하고 Claude를 몇 시간 동안 실행하여 더 복잡한 제품을 만드는 방법에 대해 설명합니다.
대부분의 사람들은 이것을 보고 멈춥니다. 다음과 같은 느낌을 받게 됩니다:
아, 에이전트가 더 복잡하고, 프롬프트가 더 길고, 워크플로가 더 자세하다는 사실이 밝혀졌습니다.
그러나 Alan은 정말로 살펴볼 가치가 있는 것은 표면 기능이 아니라 힘이 어느 수준까지 전달되는지라고 말했습니다.
과거에는 복잡한 작업을 완료하려면 누군가가 요구 사항을 세분화하고, 실행하고, 확인하고, 재작업하고, 모든 것을 처리해야 했습니다.
지금 Anthropic이 하고 있는 일은 모델을 똑똑한 직원처럼 만드는 것이 아니라, 전체 시스템이 원래 인간에게 속했던 조직, 감독 및 수용 권한을 인수하기 시작하는 것입니다.
하네스는 플러그인이 아닙니다. 하네스는 머신이 "관리 계층"을 늘리기 시작합니다.
여기서 정말 무서워집니다.
많은 사람들이 하네스를 보고 첫 반응은 '이건 또 다른 에이전트 프레임워크 아닌가요?'입니다.
이런 이해는 너무 얕습니다.
일반 도구의 핵심은 명령을 듣고 실행하는 것입니다. 클릭하면 건조됩니다. 아무 말도 하지 않으면 움직이지 않습니다.
그러나 하네스에는 더 이상 이 논리가 없습니다. 이것이 실제로 하는 일은 원래 인간 팀에 숨겨져 있던 노동 구조를 소프트웨어로 바꾸는 것입니다:
요구 사항을 이해하는 사람, 요구 사항을 단계별로 나누는 사람, 실행하는 사람, 확인하는 사람, 문제 발견 후 다시 실행할 권리가 있는 사람은 누구입니까?
즉, Anthropic은 더 많은 기능을 쌓는 것이 아니라 "작업 정리 방법" 자체를 시스템에 작성하는 것입니다.
이 단계가 왜 중요한가요? 과거에는 가장 따라하기 어려운 것이 단일 역량이 아니라 조직 역량이었기 때문입니다.
코드를 작성할 수 있는 사람은 많습니다.
십여 명이 넘는 사람, 십여 단계, 십여 차례의 재작업을 정리하고 마침내 안정적으로 전달할 수 있는 사람은 거의 없습니다.
그리고 하네스가 닿는 부분이 바로 이 수준에서 가장 비싼 것입니다.
도구는 효율성을 높이고 조직은 결과를 결정합니다.
단일 모델은 노동일 뿐이고 Harness는 기업 구조에 대한 느낌을 갖기 시작했습니다.
일을 수행하는 방법을 알 뿐만 아니라 작업을 분할하고, 넘겨주고, 책임을 질 수 있게 되면 더 이상 "도구가 아닙니다. 업그레이드"매우 간단합니다.
모델에서 가장 혼란스러운 점은 짧은 작업에서는 항상 매우 똑똑해 보인다는 것입니다.
질문을 하면 답변이 명확하고 논리적입니다. 코드를 작성해 달라고 요청하면 일반적으로 괜찮은 방식으로 응답합니다. 너무 많은 사람들이 짧은 작업은 할 수 있으니 긴 작업은 더 오래 뛰면 되는 문제가 아닌가 하는 착각을 하고 있는 것일까요?
전혀 그렇지 않습니다.
긴 작업에서 정말 어려운 부분은 특정 단계를 수행할 수 없는 것이 아니라 수십 개의 연속 단계를 거친 후에도 왜곡, 통제력 상실 또는 자기기만 없이 수행할 수 있다는 것입니다.
프로젝트 작업을 할 때 인간도 마찬가지입니다. 가장 큰 두려움은 그것을 알지 못하는 것인데 나중에 혼란이 온다:
요구사항이 명확하게 기억나지 않습니다.
타겟이 표류하기 시작합니다.
논리가 일관되지 않습니다.
결국 가장 좋은 것은 일을 끝내는 것이 아니라 끝난 것처럼 보이는 요약을 작성하는 것입니다.
Anthropic의 기사에서 언급된 핵심 문제는 본질적으로 다음과 같습니다.
모델은 장기 임무를 수행하면서 점차 영혼을 잃게 됩니다. 맥락이 길어질수록 상태는 더 혼란스러워지며, 미리 '거의 완료'라는 심리적 환상에 빠지기 쉽습니다.
하네스의 가치는 더 지능적으로 만드는 것이 아니라, 덜 산만하고, 덜 공허하며, 덜 속이기 쉽게 만드는 것입니다.
분해 단계, 핸드오버, 계약 설정, 독립적 평가 및 실패 롤백은 프로세스 세부사항처럼 보일 수 있지만 실제로는 모두 동일한 기본 문제를 해결하고 있습니다.
지능은 불안정할 수 있지만 전달은 우연에 맡길 수 없습니다.
그러므로 하네스를 정말로 이해하고 싶다면 먼저 한 가지를 이해해야 합니다.
미래의 진정한 가치는 누가 가끔 놀라운 데모를 만들 수 있느냐가 아닙니다.
하지만 누가 시스템이 완료되지 않은 작업 없이 몇 시간, 며칠 또는 그 이상 계속해서 작업을 진행하도록 할 수 있습니까?
글을 쓸 수 있는 것은 이상한 일이 아닙니다.
글이 끝날 때까지 무너지지 않았다는 게 놀랍습니다.
순간의 영감은 가치가 없지만 안정적인 전달은 가치가 있습니다.
Alan은 Anthropic에서 가장 차가운 것은 기획자나 생성자가 아니라 평가자라고 말했습니다.
왜요?
대형 모델에는 인간과 매우 유사한 문제가 있기 때문에 스스로 만드는 것은 항상 기분이 좋습니다.
외부 제약이 없는 한 '대체로 좋다', '기본적으로 완료됐다', '핵심 기능은 이미 사용 가능하다'는 자체 평가는 쉽다.
문제는 이런 평가가 거짓말이 아닌 일종의 체계적인 자기 용서인 경우가 많다는 점입니다.
인간 회사의 많은 프로젝트가 결국 뒤집히는 이유는 무엇입니까?
일하는 사람들은 흔히 자기 변명에 가장 능숙하기 때문입니다.
해본 사람들은 거의 끝났다고 하더군요.
수락하는 사람이 너무 게으른 나머지 깊이 들여다보지 못해요.
그래서 "거의" 것이 끝까지 출시되었고 마침내 사용자의 손에서 폭발했습니다.
Anthropic의 잔인한 점은 이 문제를 직접적으로 분리하는 것입니다.
일이 곧 역할입니다.
잘못은 다른 캐릭터에게 있습니다.
전자는 발전을 담당하고, 후자는 의심을 담당합니다.
이것의 배경에는 매우 깊은 논리가 있습니다.
제작권과 평가권이 분리되면 시스템은 진정한 폐쇄 루프를 형성하기 시작합니다.
더 무서운 점은 Anthropic이 평가자가 "여기서 기분이 나빠요"라는 몇 마디 말만 하도록 허용하지 않는다는 것입니다. 가능한 한 "결함 찾기"를 구조화하려고 노력하고 있습니다.
기능을 테스트하고, 페이지 핵심 사항을 확인하고, 인터페이스를 확인하고, 데이터베이스 상태를 확인하고, 디자인 품질도 점수를 매길 수 있는 차원으로 분류해야 합니다.
이게 무슨 뜻인가요?
수단과거 인간에 의해 신비화되었던 많은 판단 권리가 프로세스, 표준, 임계값으로 조금씩 세분화되고 있습니다.
가장 먼저 자동화되는 것은 체력이 아니라 결점 찾기인 경우가 많습니다.
"이게 작동할까요?" 간소화되면 많은 사람들의 경험이 누출되기 시작합니다.
과거에는 많은 직위가 정말 가치가 있었습니다. 생산 능력 때문이 아니라, "이건 과한 일이냐?"라고 말할 권리가 있었기 때문입니다.
이제 이 힘이 사람들의 손에서 풀리기 시작했습니다.
<섹션> <섹션> <섹션> <섹션> <섹션>Alan은 Anthropic의 가장 멋진 점은 기획자나 생성자가 아니라 평가자라고 말했습니다.
왜요?
대형 모델에는 인간과 매우 유사한 문제가 있기 때문입니다. 스스로 만드는 것은 항상 기분이 좋습니다.
외부 제약이 없는 한 '대체로 좋다', '기본적으로 완료됐다', '핵심 기능은 이미 사용 가능하다' 등의 자체 평가는 쉽다.
문제는 이런 평가가 거짓말이 아닌 일종의 체계적인 자기용서인 경우가 많다는 점이다.
인간 회사의 많은 프로젝트가 결국 뒤집히는 이유는 무엇인가요?
일하는 사람들은 종종 자기 변명에 가장 능숙하기 때문입니다.
만든 사람이 거의 다 됐다고 하더군요,
그것을 받아들인 사람들은 너무 게으른 나머지 깊이 들여다보지 못했어요,
그래서 '거의' 것이 쭉 공개되었고, 마침내 사용자들의 손에서 폭발했습니다.
Anthropic의 잔인한 점은 이 문제를 직접적으로 분리하는 것입니다.
일을 하는 사람이 역할이다
잘못을 찾은 것은 또 다른 캐릭터였습니다.
전자는 발전을 담당하고, 후자는 의심을 담당합니다.
이것의 배경에는 매우 깊은 논리가 있습니다.
제작권과 평가권이 분리되면 시스템은 진정한 폐쇄 루프를 형성하기 시작합니다.
더 무서운 점은 Anthropic이 평가자가 "여기는 좋지 않은 것 같아요."라는 몇 마디 말만 하게 두지 않는다는 것입니다. 가능한 한 "결함 찾기"를 구조화하려고 노력하고 있습니다.
기능을 테스트해야 하고, 페이지의 핵심 사항과 인터페이스를 확인해야 하며, 데이터베이스 상태를 확인해야 하며, 디자인 품질도 점수를 매길 수 있는 차원으로 나누어야 합니다.
이것은 무엇을 의미하나요?
이는 과거 인간이 신비화했던 많은 판단권이 조금씩 과정과 기준, 한계점으로 세분화되고 있음을 의미합니다.
가장 먼저 자동화되는 것은 체력이 아니라 결점 찾기인 경우가 많습니다.
일단 "이게 작동할까요?" 간소화되면 많은 사람들의 경험이 누출되기 시작합니다.
과거에는 많은 직업이 정말 가치가 있었습니다. 생산할 수 있어서가 아니라 "이게 그럴 가치가 있을까?"라고 말할 권리가 있었기 때문입니다.
이제 이 힘이 사람들의 손에서 풀리기 시작했습니다.
이런 종류의 기사를 볼 때 많은 사람들의 조건 반사는 '프로그래머가 멸망할 것인가?'입니다.
Alan은 이런 종류의 질문이 너무 피상적이고 너무 게으르다고 말했습니다.
하네스 먹의 첫 번째 물결은 특정 전문명이 아닙니다.
먼저 먹는 것은 거의 모든 지식 작업에서 공통적으로 나타나는 오랜 생존 방식입니다.
요구사항이 명확하지 않은 경우 먼저 수행하세요.
중간에 틀렸으니 나중에 고치겠습니다.
효과는 평균 수준이지만 실행할 수 있습니다.
문서가 명확하게 작성되지 않았지만 팀원 모두가 이해합니다.
먼저 온라인에 연결하고 나중에 문제를 해결하세요.
직설적으로 말하면 모호한 공간과 인간의 유연성을 기반으로 한 일련의 작업 방식입니다.
많은 프로젝트가 나아갈 수 있는 이유는 그 과정이 너무 명확해서가 아니라, 경험과 자리 채우기, 일시적인 판단에 의지해 중간에 부족한 부분을 채워주는 사람들이 늘 있기 때문입니다.
하네스는 정반대입니다.
모호한 공간을 압축합니다.
인터페이스 공간을 압축합니다.
'생각'이 '거의', '괜찮을 것'이라고 생각했던 생활공간을 압축한 것이 입니다.
먼저 이번 라운드에서 수행할 작업을 정의한 다음 작업을 시작하세요.
만족스럽지 않으면 다시 전화해 주세요.
테스트에 실패하면 계속하세요.
느끼지 말고 증거를 원하세요.
이 논리가 추진되면 가장 위험한 사람은 코드 작성을 가장 잘하는 사람이 아니라 생존을 위해 회색지대에 가장 많이 의존하는 사람이 될 것입니다.
하네스는 프로그래머를 잡아먹지 않고 모호함을 먼저 잡아먹습니다.
모든 사람이 교체되는 것은 아니지만 모호함에 의존하여 살아가는 모든 직위는 먼저 평가절하될 것입니다.
과거에는 정보 차이에 의존해 살아남는 직위가 많았습니다. 미래에는 표준편차로 인해 많은 직위가 사라질 것입니다.
이런 워크플로 유형의 작업은 이전에도 이루어졌는데 왜 이번에는 사람들이 진지하게 받아들이기 시작하는 걸까요?라고 묻는 사람이 많습니다.
이전 베이스 몰드가 충분히 강하지 않았기 때문입니다.
더 직설적으로 말하면:
과거에는 이러한 프레임이 보기에는 아름답지만 달리기에는 무거웠지만 충분히 단단하지 않은 것으로 나타났습니다.
여러 프로세스와 역할을 구축하고 여러 규칙을 작성합니다. 결국에는 신뢰할 수 없는 모델을 더 복잡하고 신뢰할 수 없는 시스템에 패키지화할 뿐입니다.
따라서 과거에는 많은 사람들이 에이전트, 워크플로, 스캐폴드에 대해 인내심을 잃었습니다. 이는 정상적인 현상입니다.
방향이 잘못된 것이 아니라 섀시가 그 단계에 도달하지 못한 것입니다.
지금은 다릅니다.
모델이 특정 임계값을 넘으면 원래 장식처럼 보였던 많은 프로세스가 처음으로 실제 가치를 방출하기 시작합니다.
베이스 몰드가 충분히 강하면 프로세스가 더 이상 폐기물을 지원하지 않고 이미 지속적으로 작동하고 있는 시스템을 증폭시키기 때문입니다.
이것이 하네스가 이제 갑자기 "진짜"처럼 보이는 이유입니다.
그 개념이 오늘 막 등장한 것은 아니지만 모델이 마침내 프로세스 배당금을 거둘 수 있을 만큼 강력해졌습니다.
Alan이 정확하게 말했습니다:
모델 성능은 엔진이고 하네스는 기어박스입니다.
이전에는 좋은 엔진도 없었고, 기어박스가 아무리 좋아도 장식에 불과했습니다.
그러나 엔진이 충분히 강력해지면 기어박스는 누가 고속도로를 달릴 수 있는지, 누가 여전히 가속 페달을 밟고 있는지 결정하기 시작합니다.
따라서 이 물결은 단순한 기술 트렌드가 아니라 업계에서 더 깊은 신호를 보내고 있습니다.
미래의 경쟁은 누가 더 강력한 모델을 가지고 있는지가 아니라, 누가 먼저 모델을 생산 시스템에 컴파일할 수 있는지입니다.
마침내 Alan은 컵을 내려놓고 오늘 가장 차가운 문장을 말했습니다.
"과거에는 소프트웨어가 작동하는 것으로 보았지만 미래에는 소프트웨어가 작동하는 소프트웨어를 보았습니다."
왜 이 문장이 내 마음을 아프게 할까요?
이는 하네스가 실제로 특정 위치를 다시 작성하는 것이 아니라 과거에는 거의 누구도 의심하지 않았던 하위 수준 전제라는 사실을 깨뜨리기 때문입니다.
디지털 노동에서는 기본적으로 한 사람이 중앙에 서 있어야 합니다.
그는 작업을 해체하러 왔습니다.
그는 진행 상황을 모니터링하기 위해 옵니다.
그는 품질을 판단합니다.
그가 재작업을 조정할 것입니다.
그는 마지막 말을 하려고 여기에 왔습니다.
이 "기본적으로 중간에 있는 사람"은 프로그래머, PM, TL, 디자인 리더, QA 또는 프로젝트 관리자라고 할 수 있습니다.
이름은 중요하지 않습니다.
중요한 점은 과거에는 전체 디지털 제작 시스템이 기본적으로 이러한 인적 센터와 분리될 수 없었다는 것입니다.
Harness가 실제로 감동하는 것은 이 중앙 위치입니다.
오늘 당장 사람들을 쫓아내자는 뜻이 아니라 조금씩 증명해 보자는 뜻입니다.
일부 분해는 체계적으로 수행할 수 있는 것으로 나타났습니다.
일부 감독은 체계적으로 수행할 수 있다는 것이 밝혀졌습니다.
일부 수용이 체계적으로 이루어질 수 있다는 것이 밝혀졌습니다.
일부 롤백 및 재시도는 누구도 먼저 발견하지 않고도 처리될 수 있는 것으로 나타났습니다.
이것이 점점 입증되면 사람들의 입장이 단번에 사라지는 것이 아니라 가라앉기 시작할 것입니다.
기본 센터에서 예외 개입;
전체 프로세스 모니터링부터 부서리 문제만 처리;
프로세스 소유자에서 프로세스 관찰자로.
이것이 하네스가 실제로 먹는 것입니다.
프로그래머가 아닙니다.
제품 관리자가 아닙니다.
QA가 아닙니다.
그러나 이러한 문자 뒤에 숨겨진 더 깊은 가정은 다음과 같습니다.
인간은 기본적으로 프로세스의 중심에 있습니다.
이 전제가 느슨해지기 시작하면 이후 이야기는 달라집니다.
도구 시대에는 누가 도구를 더 잘 사용하느냐가 중요합니다.
하네스 시대에 이를 가장 먼저 받아들인 사람:
당신은 자연스럽게 더 이상 시스템의 중심에 있지 않습니다.