---
title: "Reducing Single-Region Risk at 4B Metrics Per Minute"
url: https://daily.dev/posts/reducing-single-region-risk-at-4b-metrics-per-minute-ogaqxgbdx
source_url: https://engineering.salesforce.com/how-salesforce-eliminated-single-region-risk-and-reduced-downtime-blast-radius-at-4b-metrics-min
type: article
source: "Salesforce Engineering"
published: 2026-08-05T19:24:48.054Z
updated: 2026-08-05T20:29:53.846Z
tags: ["observability", "distributed-systems", "elk"]
reading_time: 7
upvotes: 2
comments: 0
language: en
---

> ## Documentation Index
> Fetch the complete documentation index at: https://daily.dev/llms.txt
> Use this file to discover all available pages before exploring further.

# Reducing Single-Region Risk at 4B Metrics Per Minute

**[Salesforce Engineering](https://daily.dev/sources/salesforceeng)** · 7 min read · 2 upvotes · 0 comments

## Summary

Salesforce's Argus team shares how they re-architected their internal observability platform to eliminate single-region AWS dependency while handling 4 billion metrics per minute. The original centralized model meant a single regional outage could take down global metrics visibility. Over six months, three teams redesigned the system into a geo-local model that processes and stores metrics closer to their origin, reducing cross-region data transfer costs and blast radius. A federation query layer backed by Elasticsearch routes requests only to relevant geographies, handles partial results gracefully, and returns HTTP 206 responses when a region is unavailable. The new architecture is live in 4 of 5 production regions, with OpenTSDB and HBase as core storage layers and metadata caching keeping wildcard query latency low.

## Full article

daily.dev links to this article rather than hosting it. Read it at the original source: <https://engineering.salesforce.com/how-salesforce-eliminated-single-region-risk-and-reduced-downtime-blast-radius-at-4b-metrics-min>

## Similar posts on daily.dev

- [Building a fault-tolerant metrics storage system at Airbnb](https://daily.dev/posts/building-a-fault-tolerant-metrics-storage-system-at-airbnb-f0xbyewgv) · Airbnb · 1 upvotes · 0 comments
- [Elastic’s new metrics capabilities will dramatically improve uptime for public sector IT](https://daily.dev/posts/elastic-s-new-metrics-capabilities-will-dramatically-improve-uptime-for-public-sector-it-1tv2tpxd0) · elastic · 0 upvotes · 0 comments
- [10 trillion samples a day: Scaling beyond traditional monitoring infra at Databricks](https://daily.dev/posts/10-trillion-samples-a-day-scaling-beyond-traditional-monitoring-infra-at-databricks-nvnrsbnfl) · databricks · 0 upvotes · 0 comments

---

Tags: [#observability](https://daily.dev/tags/observability), [#distributed-systems](https://daily.dev/tags/distributed-systems), [#elk](https://daily.dev/tags/elk)

[View this post on daily.dev](https://daily.dev/posts/reducing-single-region-risk-at-4b-metrics-per-minute-ogaqxgbdx)
