포스트

SwarmWorld: 언어모델 에이전트 사회의 스티그머지 기반 기술 진화

목차

  1. 개요
  2. 방법론
  3. 주요 결과
  4. 한계와 주의사항
  5. 결론
  6. Reference

개요

MIT LAMM 연구진이 발표한 SwarmWorld는 언어모델 에이전트 집단이 역할 지정이나 레시피 없이 공유 환경만으로 기술 사회를 형성할 수 있는지를 검증한 연구다. 기존 멀티 에이전트 시스템 대부분은 직접 대화, 사전 정의된 역할, 중앙집중식 워크플로에 의존한다. SwarmWorld는 그 반대 방향을 택한다. 초기에 완전히 동질적인 에이전트들이 공간 환경을 탐색하고, 자원을 가공하고, 재료를 테스트하고, 영속적인 아티팩트를 짓고, 결정론적 시뮬레이터가 실행하는 컨트롤러 프로그램을 작성한다.

핵심 질문은 “LLM 에이전트가 소통할 수 있는가”가 아니라 “상호작용이 동일한 계산 자원을 쓰는 독립 탐색보다 더 강한 기술 생태계를 만들어내는가”이다. 이를 반증 가능하게 만들기 위해 저자들은 매 조건을 동일한 결정 기회를 받은 N개의 고립 에이전트 세계의 엔드포인트별 best-of-N 엔벨로프와 짝지어 비교했다.

결과는 조건부 우위였다. 공유 물리 세계는 보유 기술 포트폴리오의 폭과 회복력, 검증된 발명 수에서 일관되게 독립 탐색을 앞섰다. 그러나 단일 최고 아티팩트 성능에서는 독립 탐색이 여전히 경쟁력을 유지했다. 논문의 표현대로 이는 “보편적 군집 우위”가 아니라 “경계가 있는 군집 우위(bounded swarm advantage)”다.

방법론

인지와 결과의 분리

SwarmWorld의 설계 원칙은 제안(proposal)과 결과(consequence)의 분리다. 에이전트가 내놓는 아이디어, 메시지, 설계는 모두 에이전트가 주장한 내용에 불과하다. 무엇이 실제로 지어질 수 있고 무엇이 기능하는지는 결정론적 시뮬레이터만이 결정한다.

각 에이전트는 스태거드 매크로턴(staggered macroturn) 스케줄에 따라 자기 차례가 오면 지역 관측과 사적 메모리, 조건이 허용하는 공유 기록만을 받는다. 그 후 LLM이 연구 상태 갱신과 최대 L개의 원자적 액션 계획을 담은 단일 JSON 객체를 반환한다. 액션은 큐에 들어가고 시뮬레이터 틱당 에이전트당 한 개씩만 시도된다. 따라서 에이전트는 모든 이동과 물리 조작마다 LLM 호출을 소모하지 않고도 다단계 전략을 세울 수 있다.

시뮬레이터는 모든 시도된 액션을 공간, 물질, 에너지, 처리별 제약에 대해 검증한 뒤에야 세계를 변경한다. 그다음 환경 필드와 소스-싱크 회계가 적용된 자원을 전진시키고, 설치된 모든 아티팩트 프로그램을 실행한다. 스키마 검증에 실패한 출력은 기록된 안전 대기(safe wait)가 되며 eval, exec, 셸, 아티팩트 가상머신에 도달하지 않는다.

메커니즘 분해 조건과 홀드아웃 평가

과학적 과제는 그대로 두고 메커니즘만 제거하는 네 가지 조건이 설정되었다.

조건사용 가능한 상호작용 기반
Full culture공유 물리 세계, 명시적 문화 행위(메시지, 공개 기록, 교육, 거래, 태스크 청구), 에이전트 간 실행 프로그램 상속, 아티팩트 스티그머지
No communication공유 세계와 물리적 스티그머지 유지. 메시징, 출판, 교육, 거래, 태스크 청구, 출판 의존 조합 제거. 물리적으로 관측 가능한 프로그램 재사용과 포크는 유지
No explicit culture공유 세계와 물리적 스티그머지만 유지. 통신, 프로그램 포크, 에이전트 간 시퀀스 상속, 스킬 라이브러리, 저작 텍스트, 변이 부모 접근을 모두 제거
Independent searchN개의 고립된 1인 세계. 멤버 i는 공유 세계 에이전트 i와 초기 위치와 매크로턴 위상이 일치. 각 엔드포인트는 N개 멤버의 최댓값

어블레이션은 모델 프롬프트에서 기능을 쓰지 말라고 요청하는 방식이 아니라, 광고된 액션 스키마와 실행 엔진 계약 양쪽에서 해당 능력을 제거하는 방식으로 구현되었다.

Independent search는 의도적으로 강한 대조군이다. 승자가 엔드포인트별, 체크포인트별로 달라질 수 있는 엔벨로프이기 때문이다. 발견 AUC에서 이긴 고립 멤버와 포트폴리오 회복력에서 이긴 멤버가 다를 수 있고, 각 지표마다 최선의 멤버가 선택된다.

홀드아웃 평가는 발견과 평가를 분리한다. 지정된 체크포인트에서 세계와 기술 포트폴리오를 동결하고 모든 에이전트를 제거한다. 동일한 복제본 8개를 만들어 각각에 오염, 가뭄, 폭풍의 중심과 타이밍, 순서가 새로 바뀐 미공개 교란 스케줄을 적용한다. 평가 구간에서 에이전트 액션은 0이며 결정론적 물리와 설치된 아티팩트 프로그램만 계속 동작한다. 즉 “발명자가 사라진 뒤에 남겨진 기술이 새로운 스트레스로부터 서식지를 보호할 수 있는가”를 묻는다.

실행 가능한 아티팩트 컨트롤러

에이전트는 영속 아티팩트에 결정론적 직선형(straight-line) 컨트롤러를 설치할 수 있다.

항목사양
명령어 수1개에서 64개
레지스터16개 부동소수점, 값은 -4에서 4로 클리핑
센서지역 습도, 영양분, 온도, 일조, 오염, 아티팩트 건강도와 성숙도, 저장량과 예비량, 개구율, 측정된 재료 물성
연산상수, 복사, 덧셈, 뺄셈, 곱셈, 최대/최소, 비교
액추에이터물 수집, 성장, 치유, 개구율 변경, 오염 제거, 신호 방출
금지 사항점프, 루프, 호출, 임포트, 동적 할당, 네트워크 접근, 파일 접근, 코드로 해석되는 문자열
처리량 상한확장적 액추에이터당 틱당 정규화 단위 0.05

프로그램 식별자는 정규화된 명령어 내용의 SHA-256으로 결정된다. 이름, 저자, 주장된 조상 관계로는 정체성을 위조할 수 없다. 포크가 허용된 조건에서 에이전트는 자신이 작성했거나, 관측했거나, 교육받았거나, 상속한 프로그램만 사용할 수 있고 자식 프로그램은 최소 한 개의 명령어를 변경해야 한다. 레지스트리는 정확한 부모와 자식 식별자, 저자, 설치 이벤트, 명령어 diff를 보존한다.

아티팩트 플럭스는 소스-싱크 회계로 닫혀 있다. 물 수집은 저장고에 들어간 양만큼 지역 필드에서 제거하고, 오염 제거는 존재하는 양보다 많이 제거할 수 없으며, 성장과 치유와 수리와 영양분 방출은 한정된 체화 예비량을 소비한다.

실험 셋업과 하이퍼파라미터

에이전트는 조건 내부와 조건 간에 모두 동질적이었다.

항목설정
모델gpt-5.6-luna, temperature 0.7, low reasoning effort
출력 토큰4,096
계획 액션 최대 개수12
검색 컨텍스트 예산60,000자
사적 메모리 레코드64
월드 격자72 x 54 셀 고정 (인구가 늘어도 면적은 동일, 밀도만 변화)
엔진 리비전9

800틱 인구 스케일링 연구는 4개 조건 x N in {50, 100, 200} x 발견 시드 3201-3204로 총 48개 에피소드를 구성했다. 매크로턴 간격이 50이므로 각 에이전트는 16회의 예정된 결정 기회를 받았고, 대응하는 공유 세계 멤버와 고립 멤버는 위상이 동일했다. 발견 종료 후 최종 상태를 8부 복제해 홀드아웃 시드 9201-9208로 각각 288 물리 틱을 에이전트 없이 진행했다. 전체 매트릭스는 89,617회의 프로바이더 호출을 요구했고 재시도 가능한 실패 17건(0.019%)은 월드 시간을 전진시키지 않고 반복되었다.

3,200틱 장기 연구는 별도로 분석되었으며 800틱 매트릭스와 통합되지 않았다. N = 100, 발견 시드 3301-3304에 대해 full culture, no explicit culture, best-of-100 독립 탐색 엔벨로프의 12개 에피소드로 구성된다. 각 에피소드는 6,400회의 예정된 모델 결정을 제공했고, 틱 400, 800, 1,600, 2,400, 3,200에서 동결 상태를 평가했다.

통계 분석의 추론 단위는 독립 생성된 월드 시드다. 에이전트, 틱, 아티팩트, 프로그램 포크, 행동 윈도, 네트워크 엣지, 홀드아웃 스케줄은 모두 중첩 관측치이며 독립 반복으로 계산되지 않는다. 평균과 95% 구간은 4개 짝지어진 시드 값에 대한 20,000회 결정론적 부트스트랩 재표집으로 산출되었다. 비영 쌍이 4개일 때 양측 부호 뒤집기 검정의 최소 달성 가능 p 값은 0.125이므로, 추론은 이분법적 유의성보다 효과 크기와 짝지은 일관성, 메커니즘을 강조한다.

핵심 수식

월드 틱은 전체 세계 상태 S_t와 수용된 액션 집합 A_t에 대한 결정론적 상태 전이다.

1
S_{t+1} = F(S_t, A_t)

아티팩트 프로그램은 허용된 지역 센서 o_{a,t}를 읽고 허용된 제어 연산 u_{a,t}를 방출한다.

1
u_{a,t} = pi_a(o_{a,t})

발견 프런티어 AUC는 측정된 아티팩트 성능 p(t)의 러닝 맥스에 대한 시간 정규화 면적이다.

1
2
F(t)  = max_{tau <= t} p(tau)
D_T   = (1/T) * integral_0^T F(t) dt

균형 서비스 커버리지는 활성 아티팩트 중 각 서비스 차원의 최댓값을 취한 뒤 최소/평균 비율로 균형 페널티를 준다.

1
2
3
4
c_k(t) = max_{a in A_t} s_ak(t)
c_bar(t) = (1/K) * sum_k c_k(t)
b(t) = min_k c_k(t) / c_bar(t)
Q(t) = c_bar(t) * (1 + b(t)) / 2      # c_bar(t) 가 0 보다 클 때

홀드아웃 회복력은 에이전트 없는 평가 구간에서 위 균형 커버리지를 적분하고 8개 스케줄에 대해 평균한 값이다.

1
2
R_s   = (1/T) * integral_0^T Q_s(t) dt
R_bar = (1/8) * sum_{s=1}^{8} R_s

검증된 발명 수는 다섯 가지 게이트를 모두 통과한 아티팩트의 개수다. 재료 테스트를 통과한 레시피(r_a), 필수 설계 필드(d_a), 에이전트가 작성한 설치된 프로그램(g_a), 성능 임계 초과, 행동 신규성 임계 초과가 모두 요구된다.

1
I = sum_a 1[ r_a AND d_a AND g_a AND (p_a > p_star) AND (nu_a > nu_star) ]

환경 필드는 확산 계수 D_k와 감쇠 계수 lambda_k, 지형별 소스 항 s_k로 갱신된다.

1
F_k(t+1) = (1 - lambda_k) * ( F_k(t) + D_k * laplacian(F_k(t)) ) + s_k(x, y)

교란은 시드된 보행 가능 중심 주변에 가우시안 형태로 적용된다.

1
H_xy = eta * exp( -((x - x_c)^2 + (y - y_c)^2) / (2 * max(1, r * min(w, h))^2) )

자원 침전물의 초기화와 재생은 다음과 같다.

1
2
3
C_xy      = c * U(1 - v, 1 + v)
M_xy(0)   = C_xy * U(f_0, f_1)
M_xy(t+1) = min( C_xy, M_xy(t) + rho_xy * (C_xy - M_xy(t)) )

네트워크 분석에는 가중 Newman-Girvan 모듈러리티, 참여 계수, 밀집화 지수, 관계 재사용률이 사용되었다.

1
2
3
4
Q   = (1 / 2m) * sum_ij [ A_ij - k_i * k_j / (2m) ] * delta(g_i, g_j)
P_i = 1 - sum_c (k_ic / k_i)^2
E_cum ~ V^alpha        # V = 에이전트 수 + 건설된 아티팩트 수
rho_t = |E_{t-1} intersect E_t| / |E_t|

주요 결과

인구 스케일링 800틱 실험

인구 스케일링은 단조 증가가 아니라 메커니즘 의존적인 결과를 냈다. 아래는 각 공유 세계 조건에서 짝지어진 독립 탐색 엔벨로프를 뺀 원시 효과다. 단검 표시(†)는 95% 부트스트랩 구간이 0을 배제한 경우를 뜻한다.

지표Full culture (50 / 100 / 200)No explicit culture (50 / 100 / 200)No communication (50 / 100 / 200)
발견 프런티어 AUC-0.042 / +0.038† / +0.031+0.019 / +0.037† / +0.069†-0.032† / +0.036† / +0.035
홀드아웃 회복력 AUC+0.011† / +0.009† / +0.010†+0.013† / +0.010† / +0.015†+0.010† / +0.005 / +0.014†
포트폴리오 회복력+0.037 / +0.096† / +0.086†+0.108† / +0.130† / +0.114†+0.063† / +0.068† / +0.095†
검증된 발명 수+1.2† / +3.2† / +2.0†+4.0† / +4.0† / +6.0†+1.2 / +2.8† / +4.0†

발견 AUC는 조건 순위가 N에 따라 바뀌었다. N = 50에서는 full culture와 no communication이 독립 엔벨로프에 뒤졌고, N = 100에서는 세 공유 세계 조건이 모두 이를 넘었으며, N = 200에서는 no explicit culture가 +0.069로 가장 큰 이득을 냈다.

반면 더 견고한 지표들은 훨씬 일관적이었다. 홀드아웃 회복력은 거의 모든 공유 세계 셀에서 고립 엔벨로프를 넘었고, 포트폴리오 회복력은 전 구간에서 양의 짝지은 효과를 보였으며, 검증된 발명 수는 N = 200 no explicit culture에서 평균 6건까지 증가했다. 즉 공유 물리 기반은 광범위하게 유익했지만, 명시적 문화 장치를 추가한다고 해서 단기 성능이 균일하게 개선되지는 않았다.

역할 없이 나타난 행동 분화

역할 프롬프트나 조건 라벨 없이도 행동 분화가 발생했다. 15개의 로버스트 스케일링된 궤적 특징에 2군집 k-means를 적합시키자 아티팩트 중심 작업과 이동 탐색이 분리되었다. 첫 번째 표현형은 아티팩트 근접성, 아티팩트 결속 이동, 건설, 제어, 문화적 조정을 결합했고 두 번째는 넓은 이동과 낮은 아티팩트 관여를 유지했다. N = 200에서 아티팩트 중심 비율은 full culture 약 27%, no explicit culture 20%, no communication 17%였다.

동일 시드(3202)에서 매칭된 N = 200 궤적을 비교하면 차이가 총 이동량이 아니라 이동의 조직화에서 온다는 점이 드러난다.

조건평균 경로 길이(셀)평균 방문 지역 수아티팩트 접촉 AUC
Full culture36.03.30.31
No explicit culture36.02.70.14
No communication37.02.60.11

세 조건의 총 이동 거리는 거의 같지만 full culture 에이전트의 이동은 공유 기술 인프라와 훨씬 자주 교차했다.

200틱 단위 윈도를 사용한 더 세분화된 역할 분석은 20개 에피소드에서 22,400개의 에이전트-윈도를 만들어냈고, 에피소드 균형 표본 16,000개로 13개 특징 모델을 적합했다. 모델 선택은 실루엣 0.467의 광역 2분할을 먼저 복원한 뒤 각 부모를 두 개의 하위 모드로 분해해 constructor/operator, artifact-local caretaker, cultural coordinator, mobile surveyor 네 가지 상태를 식별했다. 3,200틱 full culture에서 constructor 비율은 0.008에서 0.535로 상승하고 coordinator 비율은 0.695에서 0.292로 하락했다. 윈도 간 상태 전환율은 800틱 실험에서 0.270 대 0.102, 3,200틱 실험에서 0.244 대 0.138로 full culture가 더 유동적이었다. 역할은 영구적 사회 계급이 아니라 반복되는 동적 상태였다.

cultural coordinator 상태는 정의 특징 두 개가 어블레이션에서 비활성화되므로 순환 논리 위험이 있다. 이를 통제하기 위해 명시적 문화/조정과 사회적 접촉 특징을 제거한 민감도 분석을 수행했고, 남은 11개의 물리/과제 특징만으로도 실루엣 0.551의 세 가지 모드가 독립적으로 지지되었다.

실행 가능한 기술 문화와 계보

문화적 기록은 물리적 건설과 실행 코드에까지 들어갔다. full culture에서 N = 50, 100, 200일 때 각각 아티팩트의 67%, 76%, 56%가 둘 이상의 에이전트 기여를 기록했고 이는 대응 어블레이션을 크게 상회했다. 에이전트 간 프로그램 포크는 프로그램 상속이 가능한 모든 조건에서 흔했으며, no communication 조건에서도 유지되었다. 해당 메커니즘이 비활성화된 조건에서는 정확히 0이었다.

Adaptive Chitin Maintenance를 중심으로 한 내용 주소화 계보는 독립적으로 작성된 여러 조상 프로그램이 6인 저자의 초점 프로그램으로 수렴한 뒤 명령어 편집이 기록된 다수의 후손으로 갈라지는 구조를 보인다. 이는 설명 텍스트 간 의미 유사도가 아니라 SHA-256 기반 포크와 설치 기록이다.

건설된 포트폴리오는 기록된 원료와 시뮬레이터 정의 기능 양면에서 다양했다. 16개의 대표 기술은 평생 최고 시뮬레이터 점수 0.790에서 0.347 사이에 분포하며, 키틴 교환 격자, 균사-광물 베일, 조수 패널, 큐티클형 막, 수리 구조물, 촉매 네트워크, 셀룰로스 트렐리스, 켈프-패각 복합재를 아우른다. 프롬프트에 주어진 템플릿이 아니라 에이전트가 만들어낸 것이다.

재료-공정 맵은 생성형 설계 주장에서 자주 혼동되는 세 층을 분리한다. 건설 원료는 빌드 시점에 소비된 물질이 무엇인지, 순서화된 제작 노드는 그 입력을 어떻게 처리했는지, 운영 플럭스는 결과 아티팩트가 실제 시뮬레이션 중 무엇을 옮기거나 소비했는지를 각각 지정한다. 사용 가능하지만 실현되지 않은 경로는 사용 불가능한 경로와 별도로 표기되어, 설계 주장이 실행된 기능으로 오독되는 것을 막는다.

기록된 프로버넌스 그래프에서 하류 도달 범위 순위는 대표적인 재사용 지식 허브를 식별했다. 가장 큰 도달 범위를 가진 것은 passive material system이었고, 그다음이 여러 유지보수 및 교환 기록이었다. 메시지를 많이 쓴 저자가 아니라 재사용된 실행 가능 아이디어가 상위를 차지했다.

3200틱 장기 실험의 지표별 교차

발견 구간을 3,200틱으로 늘려도 단일한 문화적 교차점은 나타나지 않았다.

지표교차 시점
최고 아티팩트 성능틱 800 무렵 full culture가 역전
포트폴리오 회복력틱 1,600 부근 교차
누적 아티팩트 수틱 1,600 부근 교차, 최종 평균 277.5 대 238.5
검증된 발명 수끝까지 교차하지 않음 (7.0 대 5.75로 no explicit culture 우위 유지)
홀드아웃 회복력체크포인트마다 부호가 바뀌고 틱 3,200에서 사실상 동률

틱 3,200 최종 체크포인트의 엔드포인트는 공유 사회와 고립 탐색이 각각 무엇을 최적화하는지를 분명히 보여준다.

지표Full cultureNo explicit culture고립 엔벨로프
포트폴리오 회복력0.24740.23650.1794
검증된 발명 수5.757.002.75
홀드아웃 회복력 AUCno explicit culture와 사실상 동률0.04460.0356
최고 최종 아티팩트0.2380논문 미보고0.3488

공유 세계는 더 넓은 기술 생태계를 만들었지만, 가장 강한 단일 객체를 겨루는 경기에서는 독립 병렬 탐색이 여전히 이겼다.

장기 동역학은 명시적 문화가 시간과 공간의 사용을 어떻게 바꾸는지도 드러낸다. full culture 에이전트는 종료 시점 평균 경로 길이가 98.5셀로 no explicit culture의 120.0셀보다 짧았고, 지역 밀집도는 0.1298 대 0.0877로 높았다. 틱 2,400에서 3,200 구간에서 full culture는 이동에 13.9%p 적은 활동을 배분하고 명시적 문화 행위에 20.1%p 더 많이 배분했으며 건설/제어는 1.3%p 높았다. 동시에 평균 실행 계보 깊이는 틱 400의 3.75에서 틱 3,200의 9.75까지 상승했고, 적격 포크의 약 절반이 저자 경계를 넘었다. 가장 깊은 대표 계보는 12개의 포크 엣지를 포함한다. 공간적 국소화가 비활동이 아니라 점점 깊어지는 실행 가능 문화와 동반되었다는 뜻이다.

라벨을 배제한 두 번째 모델은 이 재조직을 물리 행동만으로 확인했다. 8개 공유 세계 에피소드의 800개 전체 궤적에서 이동과 아티팩트 근접성 관련 9개 특징만 사용하고 메시지, 문화 행위, 조건 라벨, 기술 작업 카운트는 제외했다. 그 결과 full culture는 아티팩트 중심 표현형에 52.8%의 에이전트를 배치했고 no explicit culture는 31.0%였다. 짝지은 차이는 21.8%p, 시드 부트스트랩 95% 구간은 12.0에서 33.5%p, 실루엣은 0.472다.

네트워크 구조와 기술 확산

대표 full culture 시드(3301)에서 389개의 아티팩트 트랙이 100개의 에이전트 트랙과 관측, 기록된 부모 참조, 건설, 프로그램 설치, 3,924개의 전달된 메시지 수신자 엣지, 358건의 아티팩트 간 프로그램 후손 이벤트로 연결되었다. 매칭된 no explicit culture 세계는 248개의 아티팩트를 가졌고 설계상 명시적 메시지와 아티팩트 간 프로그램 후손이 없다. 네 시드 전체에서 두 조건 모두 중간 수준의 상호작용 모듈러리티를 유지했고, 연속된 커뮤니티 할당은 점점 더 지속적이 되었으며, 95% 이상의 아티팩트가 결국 비제작자에게 사용되었다.

차수를 통제한 통계 검정도 같은 방향을 가리킨다. 두 에이전트는 최소 2개의 아티팩트를 공유하고 관측된 중첩이 양쪽 에이전트의 아티팩트 차수를 조건으로 한 초기하 귀무가설을 Benjamini-Hochberg 보정(q 값 0.05 이하) 후 초과할 때만 연결된다. full culture 시드는 92개 에이전트가 관여한 1,100개의 검증된 쌍을, no explicit culture는 45개 에이전트가 관여한 261개 쌍을 포함했다. 아티팩트 공동 사용 투영에서는 full culture에서 385개 아티팩트 사이 18,563개 쌍이 동일한 보정 검정을 통과했다.

그러나 확장이 곧 중앙집중화를 의미하지는 않았다. 표시된 모든 노드의 참여 계수는 0.26 미만이었고 허브 참조선을 넘은 것은 full culture 아티팩트 4개뿐이었다. 틱 3,200에서 평균 NODF 중첩성은 0.094 대 0.096으로 거의 동일했고 평균 에이전트 참여 계수도 0.0016 대 0.0044로 0에 가까웠다. 명시적 문화는 통계적으로 지지되는 조정 경로의 수와 다양성을 늘렸지만 사회를 하나의 중앙집중 위계로 병합하지는 않았다. 나타난 구조는 소수의 허브와 브리지로 연결된, 국소적으로 응집된 기술 이웃들의 모자이크였다.

네트워크는 확장과 기억 양쪽으로 변화했다. 누적 고유 에이전트-아티팩트 연결은 참여자 수 대비 초선형으로 성장했고, 기술적 로그-로그 지수는 두 조건에서 각각 3.47과 3.48이었다. 지수는 비슷하지만 네트워크 크기는 달랐다. 틱 3,200에서 full culture는 평균 4,031.3개의 고유 연결을, no explicit culture는 2,027.3개를 가졌다. 직전 구간 관계 재사용률은 각각 0.650과 0.588이었다.

기술 확산은 full culture에서 더 빠르고 넓었지만, 단순한 발명자-채택자 메시지 캐스케이드를 따르지는 않았다.

지표Full cultureNo explicit culture
비제작자가 재사용한 아티팩트 비율99.3%96.9%
최초 재사용까지의 중앙값 시간5틱8틱
평균 채택 폭 (비제작자 수)13.537.49
물리적 관측으로 시작된 최초 재사용약 95%약 95%

제작자와 채택자 사이의 직접 접촉 모티프는 타임스탬프 셔플 귀무 대비 25틱 창에서 비율 1.175로 약하게만 초과했고 50에서 400틱 창에서는 오히려 동률선 아래로 떨어졌다. 문화는 사회 전역의 정보적, 물리적 네트워크를 바꾸고, 그 이후 에이전트는 대개 발명자로부터 직접 전달받는 대신 세계를 통해 기술을 발견했다.

구조적 녹아웃 분석은 분산 중복성과 허브 의존성을 구분한다.

제거 방식Full culture 잔존 접근성No explicit culture 잔존 접근성
에이전트 절반 무작위 제거98.3%95.2%
고차수 노드 표적 제거59.6%73.9%
브로커(높은 매개 중심성) 제거62.9%68.4%

full culture는 무작위 이탈을 견딜 만큼 참여를 넓게 분산시켰지만, 동시에 고차수와 고매개 에이전트에 충분한 트래픽을 집중시켜 표적 취약성을 만들어냈다. 자기조직화가 견고성과 인식 가능한 실패 모드를 동시에 만든 셈이다.

다른 세계로의 전이

관찰된 조직 현상이 원래의 생물재료 세계(BioFoundry)의 특정 재료 생태에 의존하는지 확인하기 위해, 저자들은 지형, 자원, 처리 경로, 환경 필드, 기능 목표를 모두 교체한 화산 재료 세계 AshenRealm을 구성했다. 72 x 54 셀 환경은 용암 수로, 흑요석 황무지, 유황 습지, 철산, 마그마 바다, 화산재 평원, 대장간 거점, 시험장을 공간적으로 분리한다.

AshenRealm 사회는 BioFoundry의 수치를 그대로 재현하지 않았다. 최고 아티팩트 성능, 발견 프런티어 AUC, 행동 신규성, 회복력, 발명 수 모두 절대값이 낮은 다른 기능 영역에서 작동했다. 그러나 다중 에이전트 건설, 에이전트 간 프로그램 재사용, 실행 계보 형성, 공간 탐색은 상당 부분 유지되었다. 라벨 배제 행동 분석 역시 아티팩트 중심 작업과 이동 탐색을 복원했고, 여기에 정지/저활동 상태가 추가로 나타났다. 성능 순위 상위 아티팩트는 평생 최고 점수 0.116에서 0.248 범위였으며 상위 네 개는 주로 흑요석 기반의 다단계 가공 설계였다.

세 번째 전이 실험인 Protein Realms는 광물과 야금이 아니라 단백질 서열을 중심으로 조직된 설계 공간을 다룬다. 이는 무제한 de novo 서열 생성이 아니라 카탈로그 조건부 타당성 세계로, 콜라겐형, 실크-엘라스틴형, 레실린형, 홍합 접착형 계열을 아우르는 12개의 점수 비공개 버전 변종을 노출한다. 에이전트는 서열, 계열, 허용된 부모 계보 정보를 받지만 숨겨진 정규화 물성, 매트릭스 친화도, 스트레스 저항 프로파일은 받지 못한다. 합법적 설계는 카탈로그 서열 1개와 최소 1개의 매트릭스를 짝짓고 펩타이드 질량 분율이 10%에서 60% 사이여야 한다.

N = 50, 시드 3801, 800틱, 조건당 800호출 예산의 단일 시드 파일럿에서 세 개의 트레이스 기반 영속 생체재료가 만들어졌다. no communication 사회는 틱 741에 셀룰로스 리치 매트릭스의 콜라겐형 CLP_PPG10 상을 설치해 틱 800 기준 건강도 0.906, 성능 0.363, 8개 스케줄 평균 홀드아웃 AUC 0.03548을 기록했다. 선정된 독립 멤버 15는 틱 388과 738에 CLP_PPG10과 실크-엘라스틴형 SELP_47K 셀룰로스 복합재를 생산했고, SELP_47K가 유틸리티 0.729, 정규화 내열성 0.726, 프로테아제 저항 0.754, 침수/전단 저항 0.634, 틱 800 건강도 0.904와 성능 0.418로 가장 강했다. full culture와 no explicit culture는 각각 13건과 10건의 제안을 냈지만 주어진 구간 내에 유효한 검정을 완료하지 못했다. 53개 트레이스 전부가 프로바이더 오류 없이 완료되었고 결정론적으로 리플레이되었다.

한계와 주의사항

논문은 주장을 증거에 비례하게 유지할 것을 명시적으로 요구한다.

첫째, 추론의 기반은 조건당 4개의 매칭된 월드 시드, 단일 모델과 단일 프롬프트 구성, 시뮬레이터가 정의한 재료 및 환경 기능이다. 비영 쌍이 4개일 때 부호 뒤집기 검정의 최소 p 값은 0.125이므로 이분법적 유의성 판정은 성립하지 않는다.

둘째, 재료 물성은 SI 단위로 보정된 예측이 아니라 투명한 게임 수준의 대리 지표다. 평가기는 조성, 순서화된 공정, 수화, 다공성, 정렬, 가교, 품질을 결합해 정규화된 강성, 인성, 투과성, 접착성, 치유성, 반응성, 분해성 값을 산출한다.

셋째, 논문 그림의 기술 초상화는 기록된 기하, 조성, 레시피, 컨트롤러로부터 생성된 메커니즘 시각화이며 시뮬레이터의 실제 메시나 실험적으로 제작된 구조물이 아니다.

넷째, 구조적 녹아웃 분석은 기록된 네트워크의 그래프 위상을 측정한 것이지 에이전트를 실제 실행 중인 세계에서 제거한 뒤의 물리적 서비스, 적응, 회복을 입증한 것이 아니다.

다섯째, BioFoundry와 AshenRealm은 서로 다른 자원, 목표, 기능 스케일을 인코딩하므로 두 세계의 원시 성능 값을 과제 난이도의 매칭 비교로 해석해서는 안 된다.

여섯째, Protein Realms 파일럿은 단일 시드의 서술적 결과이며 조건 간 추론적 비교를 지지하지 않는다. 숨겨진 프로파일은 생화학적 예측이나 새로운 측정이 아니라 고정된 시뮬레이터 사전값이다.

일곱째, 동일한 결정 기회가 동일한 토큰 사용량을 뜻하지는 않는다. 문화적 맥락이 프롬프트를 길게 만들 수 있으므로 토큰 소비는 별도로 보고된다.

마지막으로, 800틱 확장 매니페스트 세 건은 더러운(dirty) 워크트리를 기록했고 이는 소스 파일 다이제스트와 함께 프로버넌스 주의사항으로 보존되었다. N = 200 full culture 시드 한 건에서 인프라 편차가 문서화되었으며, 결과를 검사하지 않는 사전 선언 규칙에 따라 해당 레코드만 깨끗한 재실행으로 교체하고 두 매니페스트를 모두 보존했다.

결론

SwarmWorld의 실험은 경계가 있는 형태의 군집 우위를 지지한다. 상호작용은 기술 생태계를 짓고 유지하는 데 성능이 좌우될 때 가장 가치 있고, 목표가 단 하나의 기록적 객체를 찾는 것일 때는 그렇지 않다. 800틱 스케일링 연구에서 공유 세계는 홀드아웃 회복력, 포트폴리오 회복력, 검증된 발명 수에서 일관된 이득을 냈다. 3,200틱에서 두 공유 세계 조건은 더 강한 포트폴리오와 더 많은 검증된 발명을 유지했지만 최고 단일 최종 아티팩트는 고립 탐색이 가져갔다. 집단적 커버리지와 개별 최적화의 구분이 핵심이다.

조직화 역시 창발했다. 누구도 탐험가, 건설자, 유지보수자, 문화 브로커로 지정되지 않았지만 라벨을 배제한 분석은 아티팩트 중심 표현형과 이동 탐색 표현형을 복원했다. 다중 에이전트 건설과 에이전트 간 프로그램 포크는 이 조직화가 언어 속 패턴에 머무르지 않고 영속 객체와 실행 가능한 컨트롤러에 들어갔음을 보여준다.

공유 물리 세계는 외부 메모리이자 전달 매체로 작동했다. 총 경로 길이가 비슷한 에이전트들이 아티팩트 접촉에서 크게 갈렸고, 기술 재사용은 거의 보편적이었으며 full culture에서 더 빨랐다. 그러나 최초 채택의 약 95%는 물리적 관측을 통해 일어났고 발명자에서 채택자로의 직접 접촉은 셔플 귀무 대비 일관되게 강화되지 않았다. 문화는 확산적으로 작동했다. 명시적 교환이 사회 전역의 기반을 재구성했고, 그 이후 전달의 상당 부분은 세계 자체와의 조우를 통해 이루어졌다.

더 긴 시간이 모든 문화 메커니즘을 보편적 우위로 바꾸지는 않았다. 교차 시점은 측정 지표에 따라 달랐고, 검증된 발명 수는 끝까지 교차하지 않았다. no explicit culture가 계속 높은 능력을 유지한 이유는 아티팩트 스티그머지가 강력한 형태의 분산 조정을 보존했기 때문이다. 이 결과는 통신 자체가 아니라 공유 세계를 집단 능력의 주된 원천으로 지목한다는 점에서 중요하다.

저자들이 제시하는 확장 경로는 결과 층(consequence layer)을 교체하되 측정 프레임워크는 유지하는 것이다. 레시피와 기하와 컨트롤러를 원자 단위 및 연속체 솔버에 결합해 시뮬레이터 정의 기능을 실제 재료 거동 쪽으로 옮기는 것이 첫 단계다. 측정된 환경 기록에서 홀드아웃 스케줄을 뽑고 아티팩트 컨트롤러를 임베디드 하드웨어에서 실시간 센서 스트림에 대해 실행하는 것이 두 번째다. 로봇 플랫폼과 자율 실험실이 건설, 테스트, 관측 원시 연산을 제공해 영속 아티팩트가 공유 작업 공간의 물리적 객체가 되는 것이 세 번째다. 독립 탐색 엔벨로프, 에이전트 없는 홀드아웃 검정, 프로버넌스, 실행 계보, 녹아웃 분석이 공통 평가 템플릿을 제공하므로 각 대체는 동일한 반증 가능 기준으로 평가될 수 있다.

Reference