18 KiB
Script
Méta
Quézaco
Ce dépôt contient un certain nombre de script Python que j'utilise pour faire corriger des copies par Gemini.
- Les copies sont découpées suivant les labels des questions.
- Des requêtes de correction sont faites à Gemini, qui met une note entre 0 et 4 à la question, ajoute des commentaires, et encadre certaines parties de la réponse.
- Une version pdf annotée de la copie est générée, faite pour être éditée sur tablette tactile. Le correcteur humain peut modifier la note, supprimer des commentaires de l'IA, ou ajouter des remarques manuscrites.
- Ces annotations manuscrites sont lues et recompilées en une version de la copie pour l'élève.
Disclaimer
J'utilise régulièrement cet outil et j'en suis satisfait, mais j'ai fait peu d'efforts pour le rendre universel et simple à l'emploi. Plusieurs parties de mon workflow sont spécifiques à mes représentations internes des sujets d'examens et/ou à mon environment.
L'utilisation de ce système nécessite une familiarité avec python et
la ligne de commande unix ; cette familiarité n'est probablement pas
suffisante en l'état, mais en théorie il devrait être possible de le
faire tourner sur le dossier Example qui contient une copie
initiale, les fichiers correspondant au sujet de l'interro, et des
examples du rendu final (dans le sous dossier BGnot).
Cette situation s'améliorera peut-être, mais faciliter l'utilisation de ce système n'est pas une priorité.
Limitations
Pour l'instant, la correction est faite question par question : le LLM n'a accès qu'à la partie de la copie correspondant à une question fixée. Ça ne gère donc pas les cas où un argument a été donné dans une question précédente ou autre.
Noms de labels sous Windows
Certains labels sont utilisés directement comme noms de fichiers et de
dossiers. Les labels contenant notamment : ne sont pas acceptés par
Windows. Sous Windows, les scripts refusent ces labels avant de
poursuivre et affichent la liste des valeurs à corriger. Aucune
conversion silencieuse n'est appliquée ; utiliser par exemple
Ex 1 - a) au lieu de Ex 1 : a). Le diagnostic du GUI permet de les
repérer avant de lancer une étape.
Requirements
Python
Libraries :
pip install numpy pandas matplotlib pillow pydantic pypdf pdf2image reportlab img2pdf pymupdf ftfy ezodf google
Poppler (for pdf2image)
- Linux : install poppler-utils
- Windows : Download from: https://github.com/oschwartz10612/poppler-windows and add it to your PATH
Accès à Gemini
Il faut créer une clef API pour Gemini (pas facile).
NB : Lors de la création, google offre (offrait ?) 300€ d'utilisation, mais seulement pendant les trois mois à venir.
Puis ajouter GEMINI_API_KEY à l'environnement avec :
export GEMINI_API_KEY=…
ou éventuellement, la renseigner directement dans le fichier `config.py`.
Configuration
Copier `default_config.py` en `config.py`. Éventuellement le modifier.
Interface graphique
Lancer l'assistant avec :
python gui.py
On peut aussi ouvrir directement une évaluation avec
python gui.py Interro. L'interface conserve l'état et l'historique
des étapes dans Interro/.copienator-gui.json, et les sorties complètes
dans Interro/.copienator/logs/. Une relance d'une étape antérieure ne
supprime aucun résultat ; les étapes suivantes sont seulement marquées
comme étant à revalider.
La variable SHOW_PERSONAL_STEPS de config.py permet d'afficher ou de
masquer les étapes propres au workflow personnel.
Le bouton Diagnostic… vérifie les modules Python, Poppler, LaTeX,
PDF Arranger et la configuration Gemini. Sous Windows, les exécutables
externes doivent être accessibles depuis PATH. Quand la création de
liens symboliques ou physiques n'est pas autorisée, l'export et la
préparation de A Rendre utilisent automatiquement une copie normale.
Les chemins des étapes personnelles peuvent être adaptés avec
CURRENT_SCORE_ODS_PATH, FINAL_SCORE_ODS_PATH,
FINAL_SCORE_OUTPUT_DIR et FINAL_SCORE_FONT_PATH dans config.py.
API commune pour les scripts
Le paquet copienator centralise les chemins d'une évaluation et les
écritures JSON sûres. Un script ne devrait donc plus reconstruire les
chemins partagés à la main :
from copienator import EvaluationWorkspace, atomic_write_json
workspace = EvaluationWorkspace("Interro")
atomic_write_json(workspace.correction_file, corrections)
EvaluationWorkspace.discover(path) retrouve également la racine d'une
évaluation à partir d'un fichier ou d'un sous-dossier. Sa construction
ne crée aucun fichier. La création explicite de
.copienator/logs/ et .copienator/runs/ se fait avec
workspace.ensure_control_directories(). Le chemin
.copienator/state.sqlite3 est réservé à une future couche d'état
transactionnelle.
atomic_write_json écrit d'abord dans un fichier temporaire situé dans
le même dossier, synchronise son contenu, puis remplace la destination.
Une interruption ne laisse donc pas un JSON partiellement écrit. Pour
une modification concurrente de type lire-modifier-écrire, utiliser
atomic_update_json : cet utilitaire protège l'opération complète avec
un verrou inter-processus Linux/Windows.
Convention des scripts standardisés
Les scripts standardisés exposent build_parser(), run(...) et
main(argv=None). Leur import ne lance aucun traitement. Ils acceptent
le dossier d'évaluation comme premier argument positionnel, utilisent
EvaluationWorkspace pour les chemins partagés et peuvent afficher la
trace complète d'une erreur avec --verbose.
Les codes de sortie communs sont :
| Code | Signification |
|---|---|
| 0 | réussite |
| 1 | erreur de traitement |
| 2 | arguments invalides |
| 3 | évaluation ou prérequis invalides |
| 4 | traitement partiel, avec avertissements |
| 130 | interruption par l'utilisateur |
Le GUI distingue notamment un traitement partiel d'un échec. Les scripts migrés vers cette convention sont actuellement :
copies_tools.py,grouping.pyetverify_groups.py;post-correction.pyetresolve_manual.py;cutleft.pyetsplitting_int.py;annotating.py,annotating_with_checks.pyetannotating_by_label.py;reading_annotations.pyetreading_grouped_annotations.py;export.py,import.pyetgiving_names.py.
Correction d'un paquet de copies
- Créer un fichier
namesdans le dossier courant, avec les noms/prénoms des élèves, un par ligne - Créer un dossier correspondant à l'évaluation (
Interrodans la suite) - Suivre les instructions suivantes
Étapes et Script
Utiliser `python gui.py` ou `python gui.py Interro` pour lancer un GUI qui suit automatiquement les étapes décrites ci-dessous.
Prétraitement de l'énoncé
Dans le dossier de l'évaluation, mettre les fichiers suivants de l'évaluation :
`enonce.pdf`, `enonce.tex`, `correction.tex`.
-
`python gemini_for_enonce.py Interro` or `python gemini_for_enonce.py Interro –restart`
À partir des trois fichiers précédents, se charge de détecter les labels des questions et leur contenu.
Les questions vont également être regroupées. Par la suite, quand des requêtes de corrections seront effectuées sur une question, seulement les énoncés des questions du groupe seront envoyés (et le corrigé de la question). Il faut donc que chaque groupe contienne si possible le contexte nécessaire pour comprendre la question.
Une fenêtre s'ouvre pour permettre d'éditer le résultat. Ne pas hésiter à faire des groupes plus gros que les groupes par défaut.
Après relecture le script génère :
- un fichier `labels` avec les labels des questions
- Un dossier `Text` avec le contenu textuel des questions, regroupées.
- Un dossier `Sol` avec le contenu textuel du corrigé, question par question.
- Un dossier `Text2`, qui compile un fichier `.tex` pour chaque question (utilisé pour compiler un rendu pdf du corrigé pour chaque question)
- Un dossier `Sol2`, qui compile un fichier `.tex` pour chaque correction de chaque question.
- Un dossier `Persp` avec des instruction de barème pour chaque question.
Éventuellement : vérifier et modifier les barèmes dans `Persp`.
- Alternative personnelle : `python enonce_info.py Interro`
Prétraitement des copies
Mettre les copies scannées au format pdf dans Interro.
python copies_tools.py rotate Interro(facultatif) Retourne tous les pdf de 180°, si la photocopie a été faite à l'envers.python copies_tools.py rename Interrochange le nom des copies enCopie{id}.pdf-
python page_splitter.py InterroDécoupe des copies A3 en pages A4, en retirant les pages vides.
Pour chaque page double il est possible
- de garder les deux pages
- de ne garder qu'une des deux pages.
- de jeter les deux pages
- de déplacer la délimitation à droite/gauche
Fix issues with
python page_splitter.py Interro14/Copies/Copie01.pdf python cutleft.py InterroDécoupe la partie gauche des copies, là où il devrait y avoir les labels des exercices/questions.python cutleft.py Interro --fullpageto use the full page always. Rerun on a single file withpython cutleft.py Interro/Copies/Copie01.pdfLes images et le fichier_schema.jsond'une copie sont remplacés ensemble. Fermer l'outil juste après la dernière validation ne peut donc plus interrompre un thread de sauvegarde en arrière-plan.
Labelisation et regroupement
Optional : Set proxy with export HTTPS_PROXY="http://10.0.0.1:3128"
python gemini_for_labels.py Interro, avec éventuellement--overwriteFait des requêtes à Gemini pour identifier les labels des questions dans images générées à partir des parties gauches des copies.-
python plotting.py InterroPermet de vérifier visuellement les labels trouvés.
- Sous linux, on peut faire
epour ouvrir le fichier .json et l'éditer a la main. - Quand un label est manquant, il est possible de cliquer sur l'image, ce qui copie les coordonnées dans le presse papier (sous linux…), puis on peut l'ajouter à la main.
-
Utilisation de `_`, `|…` et `…|` :
- `|…` n'est pas arrêté verticalement par son type opposé.
- `…|` est stoppé horizontalement par le `|…` le plus proche.
Pour modifier une seule copie :
python plotting.py Interro/Copies/Copie01.pdfIt also generates les
Copie01.json, à partir desCopie01_01.jsonEn cas de soucis, (par exemple les pages ne sont pas dans le bon ordre)- Réordonner les pages du fichier pdf
- Rerun
python cutleft.py Interro/Copie{id} - Rerun
python gemini_for_labels.py Interro/Copie{id}
- Sous linux, on peut faire
python splitting_int.py InterroDécoupe les copies suivant les exercices Peut-être appelé avec une seule copie. Les réponses d'une copie sont préparées dans un dossier temporaire, puis remplacent ensemble le dossier précédent. En cas d'erreur, l'ancienne version est conservée. Les réponses devenues obsolètes restent archivées dans le sous-dossierMissing.python grouping.py InterroRegroupe les mêmes questions de différentes copies en groupes de tailles raisonnables.- Facultatif :
python verify_groups.py InterroVérifie que chaque réponse PDF apparaît bien dans les métadonnées des groupes. La commande renvoie un code non nul si une réponse est absente ou si la vérification est incomplète.
Correction et annotation
Optional : Set proxy with export HTTPS_PROXY="http://10.0.0.1:3128"
- Il faut créer des persp, pour indication de comment corriger, et
relancer
enonce_info.py -
python correction.py Interro --limit 240OUpython correction.py Interro/Par\ label/Ex\ 2/Group_1.jpgOUpython correction.py Interro --overwriteFais les requêtes de correction à Gemini.
L'argument
limitlimite le nombre de requêtes à Gemini Pro (chères), pour une version low cost, passer--limit 0, toutes les requêtes seront sur Gemini Flash.Will it resume ? It seems so. Best to wait a bit.
Pour diminuer le coût, il est possible de batch les requêtes, qui seront alors traitées sous au plus 24h.
python correction.py Interro --batch- OU
python correction.py Interro --batch-from 'Ex 4' python submit_batches.py Interropython batch_status.pypython fetch_batched_results.py Interropython correction.py Interro --deal-with-batched
-
python post-correction.py Interro- Essaye de corriger des erreurs d'encodage/d'accents dans
correction.json. - aussi échappe les `_` en dehors du mode math, pour LaTeX.
- Essaye de corriger des erreurs d'encodage/d'accents dans
-
Résolution manuel de conflits, s'il y en a.
Edit `manual_resolutions.txt`. Use :
- `->` or `x>` : Here set a pipe `|` before or after the new_label name
- `-x` : replace the goal
- `ss` : do nothing
- `sx` : stay, and remove goal.
- `xx` : move to goal.
- `xs` : remove old, keep goal.
Then call `python resolve_manual.py Interro`
- Call `python correction.py Interro –refaire`.
Génération des copies annotées
python annotating.py Interro(facultatif) Ajoute les annotations Gemini aux copies, enregistrées dans le dossierAnot. On peut passer l'argument--overwrite.
OU
python annotating_with_checks.py InterroAjoute les annotations Gemini, et des checkboxes à cocher. Enregistrées dans le dossierBnot,--overwriteUne seule copie peut être ciblée avec, par exemple,python annotating_with_checks.py Interro/Copies/Copie01.pdf. Le mode--refaireexige un fichierrefaire.jsonet écrit dansBRnot.
OU
python annotating_by_label.py InterrodansBGnotAjoute les annotations Gemini, et des checkboxes, et regroupe les réponses par question. Enregistrées dansBGnotNeeds : label_groups file (made automatically by this function), qui dit quelles questions regrouper.
Dans ces trois modes, les métadonnées JSON sont écrites atomiquement.
Lors d'une régénération, les nouvelles sorties sont préparées dans un
dossier temporaire voisin. Une erreur de rendu conserve donc la sortie
précédente ; pour BGnot --overwrite, le dossier complet n'est remplacé
que si tous les groupes ont été produits.
python export.py Interro(gestion perso) Cela déplace les groupes dans le dossier configuré parEXPORT_DIR(par défautExport).
Il faut ensuite annoter les fichiers dans `EXPORT_DIR` avec une tablette graphique.
Lecture de la correction manuscrite
Before : vider le dossier configuré par IMPORT_DIR (par défaut
Import), puis y copier ou synchroniser les fichiers depuis la tablette.
python import.py InterroUne fois les corrections manuelles appliquées aux fichiersConcat.pdf, il faut enregistrer le fichier annoté au même endroit, sous le nomConcat_annotated.pdf.python reading_annotations.py InterroLit lesConcat_annotateddansBnot, regénère les copies avec les modifications. Les fichiers générés (score.json,Concat.jpg, etc.) sont préparés séparément puis installés ensemble. Les entrées du dossierBnotrestent en place et une erreur de génération conserve les anciennes sorties.
OU
python reading_grouped_annotations.py InterroIdem, mais pourBGnot. Les tâches parallèles remontent leurs erreurs au processus principal au lieu de les ignorer.-
python giving_names.py Interro BGnotCrée un dossier
A Rendreavec des liens symboliques vers- La copie à rendre
- un fichier
score.jsonqui contient les notes par question
Si un nom est
Unknown: renommer à la main le dossier et le fichier dedans. -
Éventuellement, faire des modifications manuelles aux
score.json.Puis
- `python reading_annotations.py –update-score Interro`
- `python reading_grouped_annotations.py –update-score Interro`
pour mettre à jour les scores dans les images.
-
(gestion perso)
gestion_classe nepour créer l'interro puisgestion_classe we(set barème here)python update_ods.py Interrooupython update_ods.py Interro --sum(en l'absence de barème)gestion_classe regestion_classe wsentpython add_final_score.py Interro21(this makes files inServer/copies)
-
(gestion perso)
- Deploy
miqmacs-copies-assets, and - update the copies from
miqmacs.fr/admin.
- Deploy
- (gestion perso) Impression d'une copie. Via Evince » print to pdf.
Autres
Recorrection d'une seule copie (peu testé)
!! Attention, refaire ne marchera pas si tu fais une annotation non groupée into refaire !!
-
Redécoupage
python plotting.py InterroTest/Copie01.pdfpython splitting_int.py InterroTest/Copie20.pdf
-
Créer
refaire.json, avec un contenu comme[["Copie02", []], ["Copie01", ["Ex 1 : 1)"]]]
- Appeler
correctionavec –refaire. Il doit créer des groupes individuels, faire des requêtes, et remplacer les corrections précédentes (à sauver ailleurs). Ou non, si tu veux le faire à la main. - ?? Si je fais refaire, avant d'avoir créer les annotating with checks, que se passe-t-il ???
- Appeler
annotating_with_checks.py --refaire --overwrite python export.py --refaire Interro24python import.py --refaire Interro24python reading_grouped_annotations.py --refaire Interro24Avec--refaire,refaire.jsonet le dossierBRnotsont des prérequis obligatoires ; leur absence produit le code de sortie 3.
Exemple de replotting, refaire d'une copie
- replot it.
- `python splitting_int.py DS09VA/Copies/Copie25.pdf` this will get rid of old/new. !! Attention, et si ça dégage un new : bad bad bad.
- Make `refaire.json`, avec la copie, et les labels à refaire.
- `python correction.py DS09VA –refaire`
- `python annotating_with_checks.py DS09VA –refaire`
- `python import.py Interro24 –refaire`