Données scientifiques

LA SCIENCE DERRIÈRE PETTI CHAT

Les animaux ont toujours parlé. Nous avons enfin créé la machine qui écoute.

Pendant des milliers d'années, la communication entre l'humain et l'animal reposait sur l'intuition et les suppositions. Petti Chat remplace ces suppositions par des données sonores mesurables et un modèle de langage avancé. Voici comment nous y sommes parvenus.

Contexte historique

Un fossé de communication vieux de 10 000 ans.

L'humanité partage son foyer avec les chats et les chiens depuis dix mille ans. Mais durant tout ce temps, notre communication est restée fondée sur la supposition : nous avons appris par tâtonnements le sens d'une queue qui remue, le ton d'un aboiement, l'urgence d'un miaulement.

Pourtant, les sons des animaux ne sont pas aléatoires. Chaque espèce communique selon des schémas acoustiques cohérents. Le problème, c'est que ces schémas sont trop subtils pour l'oreille humaine. C'est précisément le point de départ de Petti Chat : confier à une machine la tâche de mesurer ce que l'oreille humaine ne perçoit pas.

BIOACOUSTIQUE

Qu'est-ce qu'un aboiement, au juste ?

L'aboiement d'un chien ou le miaulement d'un chat est, sur le plan physique, une onde sonore mesurable. Comme la parole humaine, ces sons peuvent être décomposés en plusieurs éléments : la fréquence (hauteur), l'amplitude (intensité), la durée et la structure harmonique. Ce domaine s'appelle la bioacoustique et il est au cœur de la recherche sur le comportement animal depuis des décennies.

Petti Chat convertit d'abord chaque son capté en un spectrogramme — c'est-à-dire une cartographie de la fréquence du son dans le temps. Grâce à des méthodes d'extraction de caractéristiques comme les MFCC (coefficients cepstraux à fréquence Mel), utilisées dans les systèmes de reconnaissance de la parole humaine, une représentation numérique de cette empreinte sonore est créée. C'est toute la différence entre « entendre » un son et le mesurer.

« Dès l'instant où vous transformez un son en donnée mesurable, vous cessez de deviner pour commencer à analyser. »
FRÉQ.

Fréquence / Hauteur

Les sons courts et aigus sont souvent liés à l'excitation ou à l'urgence ; les sons graves à un avertissement ou à un inconfort.

DURÉE

Durée et rythme

La longueur d'un son et son schéma de répétition sont déterminants pour distinguer une réaction ponctuelle d'une demande persistante.

AMPL.

Intensité / Amplitude

L'intensité du son est directement liée au niveau d'éveil émotionnel (axe calme–tendu).

HARM.

Structure harmonique

Le timbre du son porte des schémas propres à l'espèce et à l'individu ; c'est la couche qui permet au modèle de décoder le contexte.

Entraîné sur plus de 1,54 million de données réelles.

Un modèle ne vaut que par les données dont il se nourrit. Le modèle de Petti Chat n'a pas été entraîné sur des enregistrements de laboratoire contrôlés, mais sur un vaste ensemble de données collectées dans de vrais foyers, auprès de vrais animaux.

ÉCHANTILLONS ANNOTÉS1.54M+trending_upEnsemble de données mondial
VALIDATION VIDÉO3 200+ hcheck_circleComportements vérifiés
COLLABORATEURS250+medical_servicesExperts contributeurs

Vérité Terrain Vidéo : la méthode qui élimine la supposition

La façon la plus faible d'apprendre à un modèle que « ce son signifie la faim » est de se fier aux suppositions humaines. Nous avons choisi une autre voie : nous avons associé chaque enregistrement sonore au comportement réel capturé en vidéo au même instant. Ainsi, le modèle a appris un son non pas à partir d'une étiquette abstraite, mais à partir de ce que l'animal faisait réellement à ce moment-là. On appelle cela l'alignement sur la « vérité terrain », et c'est le fondement de la précision du modèle.

SÉQUENCE SON / ACTIVITÉ
VALIDATION VIDÉO
videocam
COUCHE D'ALIGNEMENT
CORRESPONDANCE : 0.9982
ARCHITECTURE DU MODÈLE

Pet-LLM : un modèle de langage conçu pour les voix animales.

Les modèles d'intelligence artificielle modernes qui traitent le langage humain n'évaluent pas les mots un à un, mais dans leur contexte. Le sens du mot « Stop » change selon qui le dit et sur quel ton. Pet-LLM applique la même logique à la communication animale : il interprète un son non pas comme un signal isolé, mais en lien avec l'état physiologique de l'animal et son contexte environnemental.

Ce qui rend cela possible, c'est une architecture multimodale. Le modèle traite simultanément trois flux d'informations distincts et les combine en une seule prédiction d'« intention ». Pris isolément, un son peut être trompeur ; évalués ensemble, les trois flux augmentent nettement la précision.

01 / ACOUSTIQUE

Signal sonore

Grâce aux caractéristiques du spectrogramme et des MFCC, la hauteur, le rythme et la structure harmonique du son sont numérisés. C'est la représentation brute de « ce qui est dit ».

02 / BIOMÉTRIQUE

Données corporelles

Les données de mouvement et d'activité déterminent dans quel état physique le son a été émis — un son au repos n'est pas le même qu'un son émis en courant.

03 / CONTEXTE

Contexte environnemental

L'heure, la fréquence de répétition et les informations sur l'environnement permettent au modèle d'interpréter correctement un même son dans des situations différentes.

Ces trois flux sont fusionnés dans un moteur transformer fondé sur l'attention. Le modèle évalue lui-même quel signal est le plus déterminant à un instant donné et produit une intention lisible en moins de 1,2 seconde en moyenne. Voici le déroulé simplifié de ce processus :

mic

SON DE L'ANIMAL

  • ACOUSTIQUE
  • BIOMÉTRIQUE
  • CONTEXTE
settings_input_component

MOTEUR PET-LLM

psychology

ANALYSE D'INTENTION

translate

INTENTION TRADUITE

Une précision mesurable.

Les valeurs ci-dessous sont des résultats de validation du modèle obtenus sur des ensembles de test indépendants. La précision en usage réel peut varier selon l'animal, l'environnement et la durée d'utilisation.

RECONNAISSANCE CHAT
94,6 %
Résultat de test du modèle obtenu sur 190 000 échantillons examinés par des experts.
RECONNAISSANCE CHIEN
92,3 %
Résultat du modèle validé sur 84 000 échantillons, dans une large plage de hauteurs vocales.
PRÉCISION DE RECONNAISSANCE VOCALE
98,6 %
Précision mesurée pour distinguer les différents types d'intentions.
COMPARAISON PETTI CHAT APPLICATIONS ORDINAIRES
Temps de réponse ~1,2 s Lent / variable
Base d'entraînement IA multimodale Correspondance sonore statique
Filtrage du bruit Oui Aucun / faible
Matériel réel Oui (collier connecté) Non
CALIBRAGE CONTINU

Il devient plus intelligent chaque jour, avec votre compagnon.

Chaque animal possède une « empreinte vocale » qui lui est propre. Grâce à un calibrage exécuté sur l'appareil (approche d'apprentissage fédéré), Petti Chat apprend dès les premiers jours les schémas propres à votre compagnon ; vos données restent sur votre appareil tandis que la précision augmente avec le temps.

  • 01Calibrage sonore de base dès le premier jour.
  • 02Apprentissage contextuel des déclencheurs propres au foyer.
  • 03Alertes de changement et d'écart sur le long terme.

Conçu de manière responsable.

ARCHITECTURE AXÉE SUR LA CONFIDENTIALITÉ

enhanced_encryption

Respect de la vie privée

Les données vocales sont chiffrées et protégées après traitement. Votre vie privée est notre priorité.

verified_user

Contribution d'experts

Notre modèle a été développé avec la contribution de vétérinaires et d'experts bénévoles.

autorenew

Amélioration continue

Notre technologie est mise à jour en permanence, en plaçant le bien-être de votre compagnon au premier plan.

Arrêtez de deviner. Commencez à comprendre.