HttpClient connection pool missing idle timeout
Les mainteneurs répondent en général sous 1 jour
Personne n'a encore pris cette issue.
Évaluation
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Accessibilité débutants
- 48/100
- Type d'issue
- Bug
- Clarté
- Plutôt claire
- Activité
- Active
- Stack technique
- java
- Domaine
- backend, networking
Piste de recherche
Start with DefaultApacheHttpClient5Factory.java and DefaultHttpClientFactory.java, then review the Apache HttpClient connection-management references and existing configuration patterns. Determine how idle timeout, time-to-live, and validation settings are handled in both factories; done means the Cloud SDK team’s intended behavior and either a safe default or supported application configuration are documented and covered by relevant tests.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Description
Summary
On BTP CF (US30, GCP), we observed 1000+ requests in the last 24 hours taking ~120 seconds across multiple CAP Java services. Each request eventually succeeds after an automatic retry, but the ~120s stall causes significant user-visible latency.
Symptom
A CAP Java service calls an external service via OData. The first attempt fails after ~120 seconds with:
{
"msg": "I/O exception (java.net.SocketException) caught when processing request to {s}->https://<masked>.us30.<masked>.cloud.sap:443: Connection timed out",
"logger": "org.apache.http.impl.execchain.RetryExec",
"level": "INFO",
"written_at": "2026-09-29T15:14:49.995Z"
}
RetryExec then immediately retries with a fresh connection, which succeeds. The target service logs show no trace of the first attempt — the request never arrived.
This pattern is observed across 7–8 different service pairs, all running CAP Java on CF/BTP, all showing the same ~120s delay fingerprint.
Current Assumption (to be confirmed by Cloud SDK team)
This is our working assumption based on log analysis and Cloud SDK Java source code inspection
Network layer hypothesis
CF/BTP egress traffic passes through a NAT gateway. NAT gateways have an idle connection timeout — the exact value likely differs between hyperscalers (AWS, Azure, GCP) and is not publicly documented for BTP. When a pooled TCP connection sits idle past this threshold, the NAT silently drops its flow table entry without sending a TCP RST or FIN. The socket remains in ESTABLISHED state on the Java side (half-open socket).
When RetryExec tries to reuse this stale socket, it calls socket.write() to send the HTTP request. Java's SO_TIMEOUT only applies to socket.read() — there is no application-level timeout on write(). The OS TCP stack retransmits until it exhausts its retry budget (on the observed Diego cells), then raises ETIMEDOUT → SocketException: Connection timed out.
Cloud SDK source — missing idle timeout configuration
Inspecting the Cloud SDK Java source (github.com/SAP/cloud-sdk-java) shows that DefaultApacheHttpClient5Factory only sets a single 2-minute overall timeout, applied to connectTimeout and socketTimeout. The available ConnectionConfig methods for controlling connection pool lifetime are not used:
// DefaultApacheHttpClient5Factory.java — current state
PoolingHttpClientConnectionManagerBuilder.create()
.setDefaultConnectionConfig(ConnectionConfig.custom()
.setConnectTimeout(timeout) // 2 minutes
.setSocketTimeout(timeout) // 2 minutes
// setIdleTimeout(...) ← not set
// setTimeToLive(...) ← not set
// setValidateAfterInactivity(...) ← not set
.build())
...
.build();
Apache HttpClient's default when these are not set is no idle timeout — connections in the pool live indefinitely. Combined with the HttpClient cache TTL of 1 hour (expireAfterAccess), the same connection pool (and its potentially stale connections) is reused for up to 1 hour.
The 2-minute overall timeout is larger than the observed ~120s OS TCP timeout, meaning the OS always fires first and the application-level timeout never has a chance to act.
The same gap exists in DefaultHttpClientFactory (HC4).
Questions
- Can you confirm that
DefaultApacheHttpClient5FactoryandDefaultHttpClientFactory(Cloud SDK Java) intentionally do not setsetIdleTimeout/setTimeToLive/setValidateAfterInactivityon the connection pool? - Do you know the NAT idle timeout values for CF/BTP on GCP, AWS and Azure? This would help determine the right default value.
- Can Cloud SDK either:
- Set a safe default idle timeout that works across all hyperscalers, or
- Expose a configuration property (e.g. via
application.yaml) so applications can set it without overriding internal SDK internals?
A custom workaround at the application level (overriding HttpClientFactory) appears technically possible but has unclear side effects given the complexity of the SDK's connection management — a proper fix at the Cloud SDK level is needed.
References
- Apache HttpClient 5 connection management docs: https://hc.apache.org/httpcomponents-client-5.6.x/connection-management.html
- Cloud SDK Java source
DefaultApacheHttpClient5Factory.java:cloudplatform/connectivity-apache-httpclient5/src/main/java/com/sap/cloud/sdk/cloudplatform/connectivity/DefaultApacheHttpClient5Factory.java - Cloud SDK Java source
DefaultHttpClientFactory.java:cloudplatform/connectivity-apache-httpclient4/src/main/java/com/sap/cloud/sdk/cloudplatform/connectivity/DefaultHttpClientFactory.java
Steps to Reproduce
Since it does not happen on every single request, there is no way for us to reproduce it.
Expected Behavior
Cloud SDK could either:
- Set a safe default idle timeout that works across all hyperscalers, or
- Expose a configuration property (e.g. via
application.yaml) so applications can set it without overriding internal SDK internals?
Used Versions
- Java and Maven version via
mvn --version: 21.0.+ - SAP Cloud SDK version: >5.31
- CAP version: 4.9.4
- Langage dominant
- Java
- Étoiles
- 41
- Forks
- 33
- Merge moyen
- 22 h 16 min
- PR mergées (30 j)
- 19
Préparer son environnement
- Aucun Dockerfile ni fichier Docker Compose
- Propose un modèle de pull request
- Lire le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Autres issues de SAP/cloud-sdk-java
-
question
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
SAP/cloud-sdk-java#1301 ·
Les mainteneurs répondent en général sous 1 jour
-
bug
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
SAP/cloud-sdk-java#1300 ·
Les mainteneurs répondent en général sous 1 jour
-
bug
Difficulté 4/5 3-5 jours Accessibilité débutants 52/100
SAP/cloud-sdk-java#1297 · 2 commentaires ·
Les mainteneurs répondent en général sous 1 jour
-
bug
Difficulté 4/5 3-5 jours Accessibilité débutants 48/100
SAP/cloud-sdk-java#1291 ·
Les mainteneurs répondent en général sous 1 jour
-
bug
Difficulté 4/5 3-5 jours Accessibilité débutants 35/100
SAP/cloud-sdk-java#1289 · 1 commentaire ·
Les mainteneurs répondent en général sous 1 jour
Toutes les issues de SAP/cloud-sdk-java
Issues similaires
-
GeminiUtil placeholder user turn ("Continue output. DO NOT look at this line ...") is flagged by prompt injection filtersPeut-être pris @innoprej l’a pris aujourd’hui. Ouverte
Difficulté 2/5 1-3 heures Accessibilité débutants 76/100
Les mainteneurs répondent en général sous 1 jour
-
Broken links in the docsOuverte
Difficulté 1/5 Moins d'une heure Accessibilité débutants 78/100
salesforce/multicloudj#667 ·
Les mainteneurs répondent en général sous 1 jour
-
Add ZammadPeut-être pris @Arslan-TR l’a pris aujourd’hui. Ouverterequest
Difficulté 2/5 1-3 heures Accessibilité débutants 66/100
endoflife-date/endoflife.date#11298 · 1 commentaire ·
Les mainteneurs répondent en général sous 1 jour
-
bug documentation
Difficulté 2/5 1-3 heures Accessibilité débutants 67/100
Les mainteneurs répondent en général sous 1 jour
-
electron tech debt
Difficulté 2/5 1-3 heures Accessibilité débutants 78/100
Les mainteneurs répondent en général sous 1 jour