Versionnée et pratique

Documentation d’Equarith.

Installez Equarith, lancez votre première recherche, comprenez les résultats, automatisez vos processus et exportez des équations.

Configurer une recherche

La configuration définit la question de modélisation, le protocole de validation, le langage d’expressions autorisé, la pression exercée sur la complexité et les conditions d’arrêt. Enregistrez ou exportez-la lorsqu’un résultat doit être reproductible.

Cible et entrées

Choisissez exactement une cible numérique et au moins une entrée numérique. La cible est exclue de la liste d’entrées normale. Un filtre apparaît lorsque le jeu de données comporte de nombreuses colonnes candidates.

La recherche ne peut pas démarrer tant que les colonnes retenues ne fournissent pas assez de lignes finies et admissibles pour la séparation demandée. En mode Démo, sélectionnez au maximum quatre entrées et rappelez-vous que seules les 200 premières lignes source sont examinées avant le retrait des lignes invalides.

Les options relatives aux variables comprennent :

  • Imposer toutes les variables sélectionnées : chaque expression publiée doit contenir chaque entrée au moins une fois.
  • Nombre minimal de variables distinctes et Nombre maximal de variables distinctes : bornes structurelles facultatives.
  • Occurrences par variable : borne facultative de répétition.
  • Autoriser la variable cible dans les fonctions d’historique : permet les termes autorégressifs uniquement dans les opérateurs d’historique. Utilisez cette option intentionnellement, car elle peut créer une fuite de données si l’évaluation future ne dispose pas des cibles passées.

Objectifs de régression

La métrique sélectionnée guide la sélection sur l’entraînement. Les valeurs de test sont calculées indépendamment lorsqu’une partition de test existe.

  • RMSE, racine de l’erreur quadratique moyenne : racine de la moyenne des résidus au carré. Plus faible est meilleur. Elle a l’unité de la cible et pénalise fortement les grandes erreurs.
  • MSE, erreur quadratique moyenne : moyenne des résidus au carré. Plus faible est meilleur et son unité est au carré.
  • MAE, erreur absolue moyenne : moyenne de la valeur absolue des résidus. Plus faible est meilleur et elle est moins dominée que RMSE par quelques grandes erreurs.
  • NMSE, erreur quadratique moyenne normalisée : MSE normalisée par la variance de la cible. Plus faible est meilleur et la valeur est indépendante de l’échelle.
  • SSE, somme des carrés des résidus : erreur quadratique totale. Plus faible est meilleur ; elle augmente avec le nombre de lignes.
  • R², coefficient de détermination : un moins l’erreur résiduelle rapportée à la variation de la cible. Plus élevé est meilleur. Il peut être négatif. Pour une cible constante, une prédiction exacte vaut 1 et toute autre vaut 0.
  • C², corrélation au carré : carré de la corrélation de Pearson entre prédiction et cible. Plus élevé est meilleur. Le signe étant supprimé, contrôlez aussi l’ajustement réel.
  • Corrélation de Pearson : corrélation linéaire signée. Plus élevé est meilleur. Pour une série constante, une prédiction exacte vaut 1 et une prédiction non exacte vaut 0.
  • Hybride corrélation/RMSE : RMSE normalisée par l’échelle plus un moins la corrélation de Pearson. Plus faible est meilleur.

RMSE est un bon premier choix général. Sélectionnez une métrique adaptée au coût réel des décisions, pas seulement celle qui donne le nombre le plus flatteur. Les objectifs personnalisés définis par expression ne sont pas exécutés par le moteur v1.0.3.

Séparation entraînement/test

Les proportions proposées comprennent l’absence de test, 50/50, 60/40, 70/30, 75/25 et 80/20. Vous pouvez aussi demander un nombre fixe de lignes d’entraînement, par exemple 100, 1 000, 10 000 ou 100 000, ou saisir un nombre personnalisé si les lignes admissibles le permettent.

  • La séparation aléatoire mélange les identités de lignes admissibles à l’aide de la graine de séparation. Elle convient à des observations interchangeables.
  • La séparation séquentielle conserve l’ordre source. Utilisez-la pour entraîner sur les premières lignes et tester sur les suivantes lorsque la chronologie compte.
  • Sans test, toutes les lignes admissibles servent à l’entraînement. La recherche reçoit davantage de données, mais aucune estimation interne sur des lignes tenues à l’écart n’est disponible.

Le jeu de test sert à la validation. Les résultats d’entraînement pilotent la sélection, même si l’affichage en direct du test peut révéler un surapprentissage. Choisir sans cesse une formule parce qu’elle paraît meilleure sur le même jeu de test transforme progressivement ce dernier en information d’entraînement.

Complexité et sélection des fonctions

La complexité maximale d’une formule vaut 65 par défaut. La complexité additionne les variables, constantes et coûts des opérations activées selon les règles structurelles du moteur. Le front de Pareto conserve l’erreur et la complexité comme deux objectifs distincts.

Le panneau Fonctions active des familles d’opérations et permet de changer leur coût individuel. Sélectionnez explicitement Valeurs par défaut pour appliquer l’ensemble prudent recommandé : addition, soustraction, multiplication, division sûre, carré, cube, sinus, cosinus, logarithme sûr, racine carrée sûre et valeur absolue. Sans cette action, le chargement initial des capacités peut laisser toutes les fonctions non historiques sélectionnées.

Un ensemble plus vaste peut exprimer davantage de formes, mais agrandit fortement l’espace de recherche et le risque d’ajustements fortuits. Commencez par les opérations justifiées par le domaine et les unités. Les changements de coûts font partie de la configuration et de l’identité du checkpoint ; ils modifient aussi directement le front de Pareto.

Consultez Référence des fonctions pour les domaines, sémantiques protégées, coûts et comportements historiques.

Coefficients et constantes

  • Optimiser les coefficients (LM) est activé par défaut. Cette option ajuste les constantes numériques après la génération des structures candidates.
  • Rapide favorise l’exploration structurelle, Équilibré conserve un polissage modéré et Précis consacre davantage d’effort à l’ajustement des coefficients.
  • Constantes entières uniquement restreint les constantes découvertes aux entiers.
  • Limiter les décimales arrondit les constantes optimisées entre 0 et 12 décimales. Cette option est indisponible avec les constantes entières.
  • Les nombres minimal et maximal de constantes imposent des bornes structurelles facultatives.

Un ajustement de coefficients plus précis peut améliorer une structure donnée, mais laisse évaluer moins de structures dans un temps fixé. Des coefficients arrondis sont plus simples à communiquer, mais peuvent dégrader l’erreur ; la formule arrondie publiée est donc réévaluée.

Évaluation et normalisation

La normalisation transforme temporairement les colonnes numériques afin d’améliorer leur conditionnement. Les formules publiées sont retranscrites dans les unités d’origine.

La stratégie d’évaluation offre trois choix :

  • Automatique emploie l’évaluation complète sur les petits jeux et le filtrage progressif lorsqu’il devient utile.
  • Désactivée évalue chaque candidat sur toutes les lignes d’entraînement admissibles.
  • Activée filtre les candidats sur un échantillon stratifié tournant puis évalue complètement les candidats prometteurs.

Un score échantillonné ne devient jamais le score final publié. Tout candidat promu doit être évalué sur la totalité de la partition d’entraînement avant sa sélection et sa publication dans Pareto.

Contrôles structurels

Les contrôles facultatifs comprennent la profondeur maximale de l’expression, le nombre d’occurrences par variable, le nombre de variables distinctes et le nombre de constantes. Des bornes serrées améliorent parfois l’interprétabilité et réduisent la durée, mais peuvent exclure la relation réelle.

Donner la priorité aux formules peu complexes commence avec un petit plafond de complexité actif et l’augmente après un plateau configurable. La fenêtre de plateau et le seuil d’amélioration décident du passage au plafond suivant. Cette stratégie est utile lorsqu’il faut épuiser les explications simples avant les plus complexes.

La taille maximale de l’historique vaut 20 par défaut et accepte 1 à 1 000. Elle borne les retards et fenêtres mobiles. Son augmentation élimine davantage de lignes de chauffe et exige plus de données antérieures pour chaque évaluation.

Arrêt et ressources

Activez Limite de temps (facultative, en minutes) et saisissez une durée pour borner une recherche interactive ; cette limite est désactivée par défaut. Vous pouvez aussi arrêter la recherche manuellement. La recherche de l’application graphique utilise tous les processeurs exposés à l’application. La préférence Threads de calcul contrôle d’autres tâches partagées en arrière-plan après redémarrage ; elle ne limite pas les threads de recherche. Utilisez la CLI sans interface avec une valeur --threads explicite si le parallélisme de la recherche doit lui-même être borné.

La recherche peut consommer beaucoup de processeur et de mémoire. Les cadences ne sont pas directement comparables entre des données, fonctions, métriques, stratégies d’échantillonnage, nombres de processeurs ou matériels différents.

Reproductibilité

Définissez la graine de séparation pour répéter une partition aléatoire et la graine de recherche facultative pour répéter les choix aléatoires de la recherche. Pour constituer un dossier défendable, conservez :

  • le jeu de données exact ou son empreinte vérifiée ;
  • les identités de la cible et des entrées ;
  • tous les filtrages et paramètres de séparation ;
  • la métrique, les fonctions et leurs coûts ;
  • les contraintes, la normalisation, le préréglage d’optimisation et les graines ;
  • les versions d’Equarith et de l’environnement Java ;
  • le nombre de workers et l’environnement de la machine.

Les recherches avec graine sont conçues pour être déterministes dans des conditions équivalentes. Un ordonnancement des threads, un nombre de workers, un environnement, un matériel ou une version différents peuvent néanmoins changer l’ordre des découvertes et le candidat équivalent retenu dans l’archive de Pareto bornée.

Poursuivez avec Exécuter une recherche.