ES /docs

QMAws::startTask | ECS failures - job_id: 106701, task_definition: nswgov-capture-3d-reconstruction-

Service
cupixworks-any-compute-agent
Occurrences
2
Status
Reported
Confidence
80%
Actionability
28%
Cluster ID
c82f919f-941d-4c2e-a6b3-5812a436ab94
First Seen
2026-04-20 14:53 UTC
Last Seen
2026-07-06 12:33 UTC
Actions

QMAws::startTask | ECS failures - job_id: 106701, task_definition: nswgov-capture-3d-reconstruction-

What Happened#

2026-04-20 14:53:09 UTC에 cupixworks-any-compute-agent 서비스에서 ECS StartTask API 호출이 실패했다. job 106701 (3D reconstruction)이 container instance e729b7aa...에 배치를 시도했으나, ScaleIn Lambda가 해당 인스턴스를 거의 동시에(~37ms 차이) DRAINING 상태로 전환하여 ECS가 배치를 거부했다. 이후 job 106701은 24분 이상 재시도했으나 가용한 g6.4xlarge 인스턴스를 확보하지 못해 실행되지 않았다.

Quick Facts#

Field Value
exception.message QMAws::startTask | ECS failures - job_id: 106701, failures: [{"reason":"DRAINING"}]
top_frame qmAws.ts:196
env production, ap-southeast-2

Timeline#

  1. 14:43:09Z — ScaleIn Lambda가 e729b7aa... 포함 4개 container instance를 DRAINING으로 전환
  2. 14:43:12Z — ScaleIn이 e729b7aa...에서 running task를 발견하고 다시 ACTIVE로 전환
  3. 14:53:09.097Z — compute-agent가 e729b7aa...를 ACTIVE/idle로 조회 (job 106701)
  4. 14:53:09.134Z — ScaleIn Lambda가 e729b7aa...를 다시 DRAINING으로 전환 (~37ms 후)
  5. 14:53:09.262Z — ECS StartTask 호출 실패: {"reason":"DRAINING"}
  6. 14:53:14Z — EC2 인스턴스 i-0b5e9608f79f727e1 종료됨
  7. 14:54~15:17Z — job 106701이 ~16회 재시도하나 매번 task size: 0 (가용 인스턴스 없음)

Scoring#

Confidence 80% · Actionability 28%

Confidence#

Dimension Score Detail
Evidence completeness 5/5 20 code refs, 4 log queries
Code path explicitness 3/3 20 file:line refs
Log evidence 2/3 section, query
RCA structure 3/3 3/3 sections
Revision history 0/3 0 revision(s)
Agent execution 3/3 success

Actionability#

Dimension Score Detail
Fix complexity 1/5 critical
Affected files 1/5 9 file(s)
Single repo 1/3 2 service(s)
Immediate actions 0/3 absent
Testability 0/3 no test info
External dependency 1/3 external deps found
Data migration 3/3 no migration