Versionnée et pratique

Documentation d’Equarith.

Installez Equarith, lancez votre première recherche, comprenez les résultats, automatisez vos processus et exportez des équations.

Comprendre les résultats et l’analyse

Equarith présente un ensemble de compromis plutôt que de déclarer une formule universellement meilleure. La validation, la structure des résidus, l’interprétabilité et la connaissance du domaine comptent toutes.

Front de Pareto

La table de résultats Recherche emploie les colonnes Complexité, Erreur d’apprentissage, Erreur de test facultative et Formule. Une formule est efficace au sens de Pareto lorsqu’aucune solution disponible n’est à la fois plus simple et meilleure sur l’objectif d’entraînement.

L’archive est bornée à 256 entrées et conserve le meilleur représentant de chaque complexité. Vous pouvez :

  • trier par complexité, erreur d’entraînement, erreur de test ou vue équilibrée ;
  • filtrer les formules affichées ;
  • choisir automatiquement un meilleur résultat selon l’entraînement ou le test ;
  • sélectionner une ligne pour ouvrir ses vues détaillées.

Une amélioration minuscule obtenue au prix d’une forte complexité est rarement utile. Cherchez un coude à partir duquel l’erreur diminue peu, puis comparez les formules voisines.

Si des lignes de test existent, le classement initial et la sélection automatique privilégient l’erreur de test ; sinon, ils privilégient l’erreur d’apprentissage. La sélection d’une ligne suit temporairement cette formule. Cliquez hors des lignes pour rétablir le suivi automatique de la meilleure solution pendant l’arrivée de nouveaux résultats.

Interpréter entraînement et test

L’objectif d’entraînement mesure les lignes qui ont guidé la sélection. L’objectif de test mesure les lignes tenues à l’écart et n’apparaît que si la séparation contient une partition de test.

  • Des comportements proches sur entraînement et test soutiennent, sans la prouver, la capacité de généralisation.
  • Un test nettement plus mauvais suggère surapprentissage, fuite de données, changement de distribution ou jeu de test trop petit pour être stable.
  • Deux résultats médiocres peuvent indiquer des variables insuffisantes, des fonctions inadaptées, une recherche trop courte, des données bruitées ou l’absence de relation déterministe compacte.
  • Un test étonnamment meilleur peut être fortuit ou provenir de difficultés différentes entre partitions.

Le sens dépend de la métrique. Les erreurs sont minimisées ; R², C² et Pearson sont maximisés. Ne comparez que des valeurs calculées avec la même métrique, les mêmes lignes et la même préparation.

Vues détaillées d’une solution

La sélection d’une solution ouvre cinq vues complémentaires :

  • Ajustement montre les valeurs observées et prédites le long de l’axe x choisi.
  • Valeurs observées et prédites montre l’écart à la relation idéale un-pour-un.
  • Résidus révèle la structure des erreurs de prédiction.
  • Pareto situe la solution dans le compromis erreur-complexité.
  • Historique de la recherche montre l’évolution de la qualité publiée.

Les contrôles de graphique permettent de choisir le numéro de ligne ou une entrée comme axe x, de réunir les séries d’apprentissage et de test, d’afficher des résidus signés ou en pourcentage, de passer les axes compatibles en échelle linéaire ou logarithmique et d’afficher la légende.

Pointez une valeur tracée pour lire ses détails. Utilisez la molette ou un geste de pincement pour zoomer autour du pointeur, faites glisser pour déplacer la vue et maintenez Maj pendant le tracé d’un rectangle pour zoomer sur une zone. Double-cliquez dans le tracé ou utilisez Recadrer, Réinitialiser, Home ou 0 pour retrouver toutes les données visibles. Dans la version 1.0.3, Recadrer et Réinitialiser recadrent tous deux la vue sur les données visibles. Lorsque le graphique a le focus, + et - commandent le zoom et les touches fléchées déplacent la vue. La barre d’outils règle grille, lignes et taille des points ; Copier, PNG et CSV copient l’image ou exportent l’image et les séries tracées.

Une échelle logarithmique omet les valeurs non positives, qui n’ont pas de coordonnée logarithmique réelle. Les résidus en pourcentage peuvent être instables lorsque la cible est proche de zéro. Lisez toujours l’état et les axes du graphique.

La barre d’outils exporte une image PNG et les séries tracées au format CSV. Pour les très grands jeux, le graphique interactif emploie un budget borné de points représentatifs ; cela limite la densité d’affichage, mais pas l’évaluation en pleine précision utilisée pour les métriques et les exports normaux de prédictions.

Indicateurs diagnostiques

Les détails comprennent RMSE, MAE, R², la corrélation de Pearson, l’erreur absolue médiane, l’erreur maximale et le nombre de prédictions invalides lorsque ces valeurs s’appliquent.

Dans les graphiques Recherche et Analyse, le résidu suit la convention observé - prédit. Le résidu en pourcentage vaut 100 × (observé - prédit) / observé ; il est indéfini lorsque la valeur observée vaut zéro et peut être instable près de zéro. Un nuage centré près de zéro est souhaitable, mais recherchez :

  • une courbure, signe d’une structure manquante ;
  • un éventail qui s’élargit, signe d’une échelle d’erreur non constante ;
  • des bandes ou marches, signe de régimes ou d’entrées arrondies ;
  • des groupes séparés par le temps ou une catégorie ;
  • de grands résidus isolés ;
  • des valeurs invalides concentrées dans une région des entrées.

Une forte corrélation peut coexister avec un biais d’échelle ou de décalage. R² peut être négatif. Une faible erreur moyenne peut masquer de rares échecs graves. Aucun nombre unique ne remplace les vues.

Actions sur une formule

Depuis une solution, vous pouvez copier la formule lisible, utiliser Copier comme pour une syntaxe cible prise en charge, exporter une solution ou tout le front, la charger comme formule initiale ou l’ouvrir dans Prédiction. Copier comme ne copie que l’expression ; utilisez l’export de fichier si le code exécutable a besoin d’une fonction complète ou de helpers.

La copie et l’export emploient l’expression publiée affichée. Si l’arrondi des constantes est configuré, le score mesuré correspond à cette expression restreinte.

Espace Analyse

L’espace Analyse sépare ses explorations de la sélection dans Recherche.

Erreur et complexité visualise le compromis de Pareto et aide à examiner les formules autour du coude.

Statistiques du jeu de données regroupe les résumés numériques :

  • qualité : nombres finis, manquants, invalides et distincts ;
  • nombres nuls, positifs et négatifs ;
  • extrêmes et quantiles de P1 à P99 ;
  • tendance centrale : moyennes arithmétique, tronquée, géométrique, harmonique et quadratique, ainsi que la somme ;
  • dispersion : étendue, intervalle interquartile, variance et écart-type de population et d’échantillon, erreur standard, coefficient de variation, écarts absolus moyen et médian, écart-type robuste ;
  • forme : asymétrie et kurtosis ;
  • incertitude : intervalle de confiance à 95 % de Student pour la moyenne ;
  • bornes de Tukey et nombre de valeurs aberrantes.

Pour les très grandes colonnes, certaines estimations de quantiles ou de valeurs distinctes sont des approximations déterministes signalées par . Une statistique indéfinie reste indisponible au lieu d’être présentée comme un zéro valide.

Corrélations fournit une matrice et un nuage de points pour la paire sélectionnée. Une corrélation décrit une association linéaire et n’identifie pas une cause. Pour un jeu large, limitez les colonnes à celles qui sont pertinentes afin de garder la matrice lisible.

Diagnostic des solutions conserve sa propre sélection ordonnée d’une à trois formules de Pareto. Il peut modifier temporairement un texte de formule valide sans toucher à Recherche, au projet ni à l’archive de Pareto. Ses cinq graphiques sont Ajustement, Valeurs observées et prédites avec référence un-pour-un, Résidus en fonction de X, Résidus en fonction des valeurs prédites et Histogramme des résidus.

Choisir une formule

  1. Rejetez les formules dont les opérations, unités ou domaines sont invraisemblables.
  2. Comparez les comportements sur entraînement et test tenu à l’écart.
  3. Examinez résidus, prédictions invalides et régions limites.
  4. Préférez la formule plus simple si la complexité supplémentaire n’apporte pas de bénéfice de validation significatif.
  5. Testez la sensibilité aux graines de séparation et de recherche.
  6. Validez sur des données représentatives de l’utilisation réelle.
  7. Exportez puis testez indépendamment l’expression publiée exacte.

Pour de nouvelles entrées, poursuivez avec Prédictions. Pour les langages cibles, consultez Exporter les données et les formules.