Vue d’ensemble
Ce que désactive le Mode Performance
Activer le mode Performance
Utilisation de l’objet config
Utilisation des fonctions définies au niveau du module
Utilisation des imports simplifiés
Activer le mode performance définit automatiquement le moteur d’exécution sur
chdb. Vous n’avez pas besoin d’appeler config.use_chdb() séparément.Quand utiliser le mode Performance
- Vous traitez de grands jeux de données (de centaines de milliers à plusieurs millions de lignes)
- Vous exécutez des charges de travail riches en agrégations (groupby, sum, mean, count)
- L’ordre des lignes n’a pas d’importance (par exemple, résultats agrégés, rapports, tableaux de bord)
- Vous recherchez un débit SQL maximal avec une surcharge minimale
- L’utilisation de la mémoire est un enjeu (lecture parallèle de Parquet, sans DataFrames intermédiaires)
- Vous avez besoin du comportement exact de pandas (ordre des lignes, MultiIndex, dtypes)
- Vous comptez sur
first()/last()pour renvoyer réellement la première ou la dernière ligne - Vous utilisez
shift(),diff(),cumsum()qui dépendent de l’ordre des lignes - Vous écrivez des tests qui comparent la sortie de DataStore à celle de pandas
Différences de comportement
Ordre des lignes
- Les résultats de filtrage
- Les résultats d’agrégation de GroupBy
head()/tail()sanssort_values()explicite- Les agrégations
first()/last()
sort_values() explicite :
Résultats de GroupBy
Agrégation
Exécution en une seule requête SQL
ColumnExpr (par ex., ds[condition].groupby('col')['val'].sum()) s’exécute sous la forme d’une seule requête SQL, au lieu du processus en deux étapes utilisé en mode pandas :
Comparaison avec le moteur d’exécution
compat_mode) et le moteur d’exécution (execution_engine) sont deux axes de configuration indépendants :
Définir
compat_mode='performance' règle automatiquement execution_engine='chdb', car le mode Performance est conçu pour l’exécution SQL.
Tests avec le mode Performance
Tri puis comparaison (agrégations, filtres)
Vérification de l’intervalle de valeurs (première/dernière)
Schéma et comptage (LIMIT sans ORDER BY)
Bonnes pratiques
1. Activez-la au début de votre script
2. Ajoutez un tri explicite lorsque l’ordre est important
3. À utiliser pour les charges de travail de type batch/ETL
4. Passer d’un mode à l’autre au sein d’une session
- Moteur d’exécution — Sélection du moteur (auto/chdb/pandas)
- Guide des performances — Conseils généraux d’optimisation
- Principales différences avec pandas — Différences de comportement