INTELIGENCIA ARTIFICIAL GENERATIVA COMO APOYO PARA LA RESOLUCIÓN
DE PROBLEMAS DE MATEMÁTICAS Y FÍSICA EN EDUCACIÓN SECUNDARIA:
REVISIÓN SISTEMÁTICA CUALITATIVA
GENERATIVE ARTIFICIAL INTELLIGENCE AS SUPPORT FOR SOLVING
MATHEMATICS AND PHYSICS PROBLEMS IN SECONDARY EDUCATION: A
QUALITATIVE SYSTEMATIC REVIEW
Autores:
¹Luis
Teodoro
Zambrano
Rodríguez,
²Hansel
Francisco
Camacho
Vega,
³Marlon
Mauricio Mayea Macias y ⁴Jessenia Rosario Vela Aguilar.
¹ORCID ID:
https://orcid.org/0009-0006-1073-6021
²ORCID ID:
https://orcid.org/0009-0003-7386-132X
³ORCID ID:
https://orcid.org/0009-0005-3159-7051
⁴ORCID ID:
https://orcid.org/0009-0008-9928-1426
¹E-mail de contacto:
luisinzr2040@gmail.com
²E-mail de contacto:
hanselcamacho570@outlook.es
³E-mail de contacto:
marlon.mayea@educacion.gob.ec
⁴E-mail de contacto:
jesseniar.vela@docentes.educacion.edu.ec
Afiliación:
1*
Autor independiente, (Ecuador).
2*
Unidad Educativa Académica Naval Altamar, Caluma, Bolívar, (Ecuador).
3*
Dirección
Distrital 12d02, Pueblo viejo, Urdaneta-Educación,
Pueblo viejo, Los Ríos, (Ecuador).
4*
Unidad Educativa 11 de Octubre, Caluma,
Bolívar, (Ecuador).
Artículo recibido: 5 de Septiembre del 2026.
Artículo revisado: 14 de Septiembre del 2026.
Artículo aprobado: 14 de Septiembre del 2026.
¹Ingeniero
en
Sistemas
Inteligentes,
graduado
de
la
Universidad
Bolivariana
del
Ecuador,
(Ecuador).
Maestrante
en
Educación
de
Bachillerato, mención en Matemática en la Universidad Estatal de Milagro, (Ecuador).
²Licenciado en Pedagogía, Física y Matemática, egresado de la Universidad de Guayaquil, (Ecuador). Maestrante en Gestión Educativa
con mención en Innovación en Dirección de Centros Educativos de la Universidad Estatal de Milagro, (Ecuador).
³Ingeniero en Sistemas, graduado de la Universidad Técnica de Babahoyo, (Ecuador). Magíster en Tecnología e Innovación Educativa,
graduado de la Universidad Técnica de Babahoyo, (Ecuador).
⁴Licenciada en Comunicación Social,
graduada de la Universidad Técnica de Babahoyo, (Ecuador). Magíster en Gestión Educativa,
graduada de la Universidad Particular de Especialidades Espíritu Santo, (Ecuador). Periodista Profesional, graduada de la Universidad
Técnica de Babahoyo, (Ecuador).
Resumen
La
inteligencia
artificial
generativa
puede
orientar la resolución de problemas, pero mejorar
el
producto
asistido
no
equivale
a
aprendizaje
independiente.
De
ahí
que
el
objetivo
de
este
estudio
sea
examinar,
en
estudiantes
de
secundaria
que
resuelven
problemas
de
matemáticas
o
física,
los
efectos
de
la
inteligencia artificial generativa (IAG) sobre el
desempeño
sin
asistencia,
la
comprensión
conceptual,
la
transferencia
y
la
retención,
y
analizar
su
variación
según
la
tarea,
la
configuración y la mediación docente. Se realizó
una
revisión
sistemática
con
síntesis
narrativa,
sin metaanálisis. Se buscaron, en ERIC, Scopus,
Web
of
Science
Core
Collection,
Education
Source
y
APA
PsycINFO,
artículos
comparativos en español o inglés sobre el
uso
directo de la IAG por estudiantes de secundaria,
publicados entre enero de 2020 y el 30 de agosto
de
2026.
Dos
revisores
seleccionaron
los
estudios y evaluaron de forma independiente el
riesgo
de
sesgo.
Tres
estudios
aportaron
hallazgos comparativos: un ensayo aleatorizado
y dos estudios cuasiexperimentales. Los apoyos
estructurados mejoraron el desempeño durante la
práctica
o
el
conocimiento
inmediato.
Sin
embargo, un chatbot abierto elevó el rendimiento
asistido
y
se
asoció
con
un
peor
desempeño
posterior sin ayuda; las salvaguardas atenuaron
el
perjuicio,
pero
no
demostraron
una
ventaja
autónoma. La transferencia y la retención no se
evaluaron por separado; la heterogeneidad y la
escasez de estudios limitaron la confianza en los
hallazgos.
No
se
estableció
un
beneficio
uniforme para el aprendizaje independiente. La
IAG
debe
emplearse
como
andamiaje
verificable,
con
un
intento
previo,
pistas
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 860
graduadas,
comprobación
independiente,
mediación
docente
y
retirada
progresiva,
no
como sustituto del razonamiento.
Palabras
clave:
Inteligencia
Artificial
Generativa,
Educación
Secundaria,
Resolución
de
Problemas,
Aprendizaje
Independiente.
Abstract
Generative
artificial
intelligence
can
guide
problem solving, but improving an AI-assisted
output is not equivalent to independent learning.
Therefore, this study aimed to examine, among
secondary school students solving mathematics
or
physics
problems,
the
effects
of
generative
artificial
intelligence
(GenAI)
on
unassisted
performance,
conceptual
understanding,
transfer, and retention, and to analyze how these
effects vary according to the task, configuration,
and teacher mediation. A systematic review with
narrative
synthesis
and
no
meta-analysis
was
conducted. ERIC, Scopus, Web of Science Core
Collection,
Education
Source,
and
APA
PsycINFO
were
searched
for
comparative
articles published in Spanish or English between
January 2020 and August 30, 2026, addressing
the
direct
use
of
GenAI
by
secondary
school
students. Two reviewers independently selected
the studies and assessed the risk of bias. Three
studies
provided
comparative
findings:
one
randomized
trial
and
two
quasi-experimental
studies.
Structured
support
improved
performance
during
practice
or
immediate
knowledge outcomes. However, an unrestricted
chatbot increased assisted performance and was
associated
with
poorer
subsequent
unassisted
performance;
safeguards
mitigated
the
detrimental
effect
but
did
not
demonstrate
an
advantage
for
independent
learning.
Transfer
and retention were not assessed separately, while
heterogeneity and the limited number of studies
reduced
confidence
in
the
findings.
No
consistent benefit for independent learning was
established. GenAI should be used as verifiable
scaffolding,
incorporating
an
initial
unaided
attempt,
graduated
hints,
independent
verification, teacher mediation, and progressive
fading, rather than as a substitute for reasoning.
Keywords: Generative Artificial Intelligence,
Secondary
Education,
Problem
Solving,
Independent Learning.
Sumário
A inteligência artificial generativa pode orientar
a
resolução
de
problemas,
mas
melhorar
um
produto elaborado com assistência não equivale
à
aprendizagem
independente.
Portanto,
este
estudo
teve
como
objetivo
examinar,
entre
estudantes
do
ensino
médio
que
resolvem
problemas de matemática ou física, os efeitos da
inteligência
artificial
generativa
(IAG)
sobre
o
desempenho
sem
assistência,
a
compreensão
conceitual,
a
transferência
e
a
retenção,
bem
como
analisar
sua
variação
de
acordo
com
a
tarefa, a configuração e a mediação docente. Foi
realizada
uma
revisão
sistemática
com
síntese
narrativa, sem meta-análise. Foram pesquisados,
nas bases ERIC, Scopus, Web of Science Core
Collection, Education Source e APA PsycINFO,
artigos comparativos publicadas em espanhol ou
inglês entre janeiro de 2020 e 30 de agosto de
2026,
referentes
ao
uso
direto
da
IAG
por
estudantes
do
ensino
médio.
Dois
revisores
selecionaram os estudos e avaliaram, de forma
independente,
o
risco
de
viés.
Três
estudos
forneceram
achados
comparativos:
um
ensaio
randomizado
e
dois
estudos
quase-
experimentais.
Os
apoios
estruturados
melhoraram o desempenho durante a prática ou
o
conhecimento
imediato.
Entretanto,
um
chatbot
sem restrições aumentou o desempenho
assistido
e
esteve
associado
a
um
pior
desempenho
posterior
sem
ajuda;
as
salvaguardas
atenuaram
o
prejuízo,
mas
não
demonstraram
vantagem
para
a
aprendizagem
independente. A transferência e a retenção não
foram
avaliadas
separadamente,
enquanto
a
heterogeneidade e o número reduzido de estudos
limitaram
a
confiança
nos
achados.
Não
foi
estabelecido
um
benefício
uniforme
para
a
aprendizagem
independente.
A
IAG
deve
ser
utilizada
como
um
recurso
de
andaimagem
verificável, com tentativa prévia sem assistência,
pistas
graduadas,
verificação
independente,
mediação docente e retirada progressiva, e não
como substituta do raciocínio.
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 861
Palavras-chave:
Inteligência
Artificial
Generativa,
Ensino
Médio,
Resolução
de
Problemas, Aprendizagem Independente.
Introducción
La
inteligencia
artificial
generativa
(IAG)
comprende
sistemas
capaces
de
producir
respuestas nuevas texto, expresiones simbólicas,
código,
imágenes
o
combinaciones
multimodales
a
partir
de
instrucciones
del
usuario.
En
el
ámbito
escolar,
estos
sistemas
pueden
explicar
procedimientos,
proponer
ejemplos, ofrecer retroalimentación y ajustar el
nivel aparente de ayuda. Esta revisión delimita la
IAG a los modelos generativos que estudiantes
de
educación
secundaria
ISCED
2–3
utilizan
directamente
para
resolver
problemas
curriculares de matemáticas o física.
Se excluyen los sistemas tutoriales inteligentes
no
generativos,
la
analítica
predictiva,
la
automatización administrativa y el uso exclusivo
de
la
IAG
por
el
profesorado
para
preparar
materiales. Tampoco se equipará el acierto de un
modelo en una prueba con un efecto educativo
en
el
alumnado.
La
distinción
es
sustantiva:
completar
correctamente
una
tarea
con
ayuda,
comprender
los
principios
que
la
sustentan
y
resolver
después
un
problema
nuevo
sin
asistencia
constituyen
resultados
diferentes.
El
valor educativo, por ello, no puede reducirse a la
fluidez
de
la
explicación
ni
al
número
de
ejercicios resueltos; debe priorizar el desempeño
independiente,
la
comprensión
conceptual,
la
transferencia
y
la
retención,
al
tiempo
que
preserva
la
agencia
humana
y
la
capacidad
de
comprobar críticamente las respuestas (Miao y
Holmes, 2023). El interés pedagógico de la IAG
radica
en
ofrecer
orientación
inmediata
y
potencialmente
personalizada
cuando
el
alumnado
necesita
múltiples
oportunidades
de
práctica
y
retroalimentación.
Sin
embargo,
resolver problemas matemáticos y físicos exige
más
que
obtener
un
resultado:
supone
representar la situación, seleccionar conceptos y
relaciones
pertinentes,
justificar
supuestos,
ejecutar
procedimientos
y
evaluar
la
plausibilidad de la solución. La literatura escolar
sobre
IAG
ha
crecido
con
rapidez,
pero
su
madurez metodológica aún es limitada.
Una revisión de 30 estudios de educación K–12
identificó solo un estudio experimental y nueve
cuasiexperimentales. Además, predominaron las
medidas
psicológicas
y
autoinformadas,
mientras
que
las
matemáticas
y
la
física
estuvieron
representadas
por
apenas
cinco
y
cuatro
estudios,
respectivamente
(Alfarwan,
2025).
Por
otro
lado,
un
metaanálisis
prerregistrado de 22 estudios sobre matemáticas,
con
46
muestras
independientes
y
N
=
5,232,
estimó un efecto global moderado (
g
= 0.534); la
magnitud varió según el modo de integración, el
contenido
y
el
tamaño
de
las
muestras,
y
la
certeza fue mayor para los resultados cognitivos
que para los no cognitivos (Liu et al., 2026).
Una síntesis de 45 estudios K–12 también señaló
el
predominio
de
intervenciones
breves
y
problemas
persistentes
de
exactitud,
dependencia, privacidad y alfabetización en IA
(Zhang
et
al.,
2026).
El
crecimiento
de
las
publicaciones,
por
tanto,
aún
no
constituye
evidencia suficiente de un aprendizaje autónomo
y
duradero.
Las
revisiones
complementarias
indican
que
el
problema
no
se
limita
a
la
disponibilidad
tecnológica.
Una
síntesis
de
la
investigación
sobre
inteligencia
artificial
en
educación
K–12
describió
un
campo
en
expansión,
aunque
heterogéneo
en
enfoques,
poblaciones y medidas (Martin et al., 2024). Una
revisión
sobre
alfabetización
en
IA,
a
su
vez,
subrayó la necesidad de articular conocimientos
técnicos,
uso
crítico
y
consideraciones
éticas
desde
la
escolaridad
(Casal
et
al.,
2023).
Las
revisiones
centradas
en
ChatGPT
y
en
IAG
identificaron
beneficios
potenciales
junto
con
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 862
riesgos de inexactitud, dependencia y evaluación
en
una
base
empírica
todavía
fragmentada
(Yusuf
et
al.,
2024;
Zhang
y
Tur,
2024).
Una
revisión sobre evaluación educativa precisó que
la generación automatizada de respuestas obliga
a distinguir el producto elaborado con asistencia
del dominio individual que una prueba pretende
inferir (Zhao et al., 2024).
La
primera
brecha
surge
de
confundir
el
rendimiento
asistido
con
el
aprendizaje
independiente. En un ensayo de campo con cerca
de mil estudiantes de secundaria, el acceso a una
interfaz
abierta
basada
en
GPT-4
aumentó
el
rendimiento
durante
la
práctica
en
un
48
%,
mientras
que
un
tutor
con
salvaguardas
lo
incrementó en un 127 % respecto del grupo de
control. Cuando se retiró la IAG para el examen
inmediato, el
grupo con acceso abierto obtuvo
calificaciones
un
17
%
inferiores
a
las
del
control;
las
salvaguardas
pistas
diseñadas
con
aportes
docentes
y
restricción
de
respuestas
directas—
atenuaron
en
gran
medida
ese
perjuicio, pero no produjeron una ventaja en la
evaluación sin asistencia (Bastani et al., 2025).
Otro
ensayo
aleatorizado
incluyó
a
371
estudiantes
de
los
grados
7.º
a
9.º
que
participaron
en
seis
sesiones
de
45
minutos
durante clases de física o inglés. Se compararon
dos
apoyos
generativos
orientados
a
la
autorregulación con el uso estándar de ChatGPT.
La
condición
centrada
en
el
valor
de
utilidad
produjo
una
evolución
más
favorable
en
la
utilidad percibida que la condición centrada en
estrategias
cognitivas;
ninguna,
sin
embargo,
superó el uso estándar de ChatGPT en esfuerzo,
conocimiento
disciplinar
o
estrategias
de
elaboración.
La
asociación
entre
interacciones
sustantivas
e
interés
sostenido
tuvo
carácter
exploratorio
(Fütterer
et
al.,
2026).
Estos
hallazgos no justifican una conclusión uniforme
de beneficio o daño. Indican que las mediciones
obtenidas
durante
el
uso
de
la
herramienta
pueden sobreestimar lo aprendido. Se necesitan
réplicas
que
distingan
de
forma
explícita
la
práctica
asistida,
la
posprueba
sin
IAG,
la
transferencia
a
problemas
no
practicados
y
la
retención a cuatro semanas o más.
La segunda brecha tiene que ver con la exactitud
de
las
soluciones,
las
explicaciones
y
la
retroalimentación
que
recibe
el
alumnado.
En
una auditoría de 40 problemas universitarios de
física
e
ingeniería,
GPT-4
resolvió
correctamente el 62.5 % de los problemas bien
especificados,
pero
solo
el
8.3
%
de
los
subespecificados; los fallos se concentraron en la
construcción
del
modelo
físico,
la
elección
de
supuestos razonables y los cálculos (Wang et al.,
2024). De forma convergente, una evaluación de
ChatGPT
con
materiales
de
un
curso
introductorio de física concluyó que el sistema
apenas alcanzaría el umbral de aprobación y que
reproducía
preconcepciones
y
errores
característicos de un principiante (Kortemeyer,
2023).
Estos
estudios
describen
la
capacidad
del
modelo, no el aprendizaje estudiantil; por ello,
no
permiten
estimar
cuántas
respuestas
plausibles
pero
incorrectas
son
aceptadas,
corregidas
o
propagadas
en
una
clase
real.
La
incertidumbre resulta especialmente relevante en
tareas
abiertas,
diagramas,
gráficos,
problemas
multimodales y situaciones con datos faltantes,
en
las
que
verificar
la
coherencia
conceptual
forma
parte
del
desempeño
que
se
pretende
enseñar.
Sin
mediciones
del
proceso
de
interacción
intentos
previos,
consultas,
comprobaciones y revisiones, un producto final
correcto no permite saber si la IAG fortaleció el
razonamiento
o
encubrió
un
error
que
el
estudiante no podía detectar. La tercera brecha
reside
en
el
diseño
pedagógico
y
sus
salvaguardas, porque “usar ChatGPT” no define
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 863
una
intervención
con
precisión
suficiente.
Un
solucionador
que
entrega
el
procedimiento
completo, un tutor socrático que exige un intento
previo
y
una
herramienta
que
solo
ayuda
a
verificar
pasos
movilizan
procesos
cognitivos
distintos.
Los
resultados
de
ALTER-Math,
un
agente generativo basado en el aprendizaje por
enseñanza y probado mediante ciclos de diseño
con
320
estudiantes
de
educación
secundaria
inferior
y
seis
docentes,
sugieren
mejoras
de
conocimiento en la comparación final; el diseño,
sin
embargo,
no
permite
aislar
con
certeza
el
componente responsable del efecto (Xing et al.,
2025).
Un
estudio
piloto
de
tres
semanas
con
74
estudiantes
de
cuarto
curso
de
secundaria
en
Hong
Kong
halló
ventajas
de
un
chatbot
generativo orientado a la autorregulación frente
a
otro
basado
en
reglas
en
conocimiento
científico,
participación
y
motivación.
Su
tamaño, duración y enfoque en ciencias limitan
la
extrapolación
a
la
resolución
autónoma
de
problemas
de
matemáticas
y
física
(Ng
et
al.,
2024).
Esta
revisión
sistemática
cualitativa
examina
el
efecto
de
la
IAG
utilizada
como
apoyo
directo
por
estudiantes
de
educación
secundaria ISCED 2–3 para resolver problemas
de matemáticas o física.
La
compara
con
enseñanza
o
práctica
equivalente
sin
IAG,
herramientas
no
generativas
o
configuraciones
alternativas,
y
considera
el
desempeño
independiente
medido
sin
IAG,
la
comprensión
conceptual,
la
transferencia
y
la
retención.
También
analiza
cómo varían los efectos según la disciplina, las
características
del
alumnado,
el
diseño
pedagógico,
la
mediación
docente
y
el
seguimiento.
El
propósito
es
determinar
si
las
mejoras
observadas
durante
la
asistencia
se
mantienen al retirar la herramienta, qué riesgos
introduce la inexactitud de sus respuestas y qué
salvaguardas permiten ampliar el razonamiento
del estudiante en lugar de sustituirlo.
El
marco
teórico
parte
de
que
la
IAG
no
constituye una intervención uniforme ni produce
un efecto educativo independiente del contexto.
Su
acción
ocurre
dentro
de
una
configuración
sociotécnica formada por el estudiante, la tarea,
el modelo y su interfaz, las instrucciones de uso,
la mediación docente y la forma de evaluación.
Esta
perspectiva
sustituye
la
pregunta
general
sobre si la herramienta funciona por el análisis
de
las
condiciones
en
las
que
modifica
la
actividad
cognitiva.
Una
misma
respuesta
generada
puede
actuar
como
pista
que
activa
conocimientos previos, como retroalimentación
que
orienta
una
revisión
o
como
solución
sustitutiva que evita modelizar y justificar.
La unidad conceptual relevante es, por ello, el
episodio de resolución asistida y no el
chatbot
aislado.
En
concordancia
con
la
pregunta
estructurada
por
población,
intervención,
comparador,
resultados,
tiempo
y
contexto
(PICOTS), el desempeño observado durante ese
episodio
debe
distinguirse
de
la
competencia
demostrada
después
de
retirar
la
IAG:
desempeño
independiente,
comprensión
conceptual, transferencia y retención.
En este marco, la alfabetización en IA se define
operativamente
como
la
capacidad
de
comprender
que
las
salidas
generativas
son
probabilísticas y falibles, utilizar la herramienta
con
una
finalidad
explícita,
formular
instrucciones
contextualizadas,
evaluar
la
plausibilidad
de
la
respuesta
y
decidir
si
debe
aceptarse, corregirse, contrastarse o descartarse.
La
definición
comprende
una
dimensión
conceptual, qué puede y qué no puede hacer el
sistema,
una
instrumental
cómo
proporcionar
datos,
restricciones
y
formato,
una
epistémica
cómo
juzgar
razones
y
evidencia
y
una
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 864
regulatoria
cuándo
solicitar
ayuda
y
cuándo
retirarla.
La
formulación
de
instrucciones
es
una
manifestación observable de esa alfabetización,
pero no la agota. Un estudiante puede redactar
una instrucción detallada y carecer, aun así, de
los conocimientos disciplinares necesarios para
detectar
una
ecuación
inaplicable,
un
supuesto
físico
imposible
o
una
inferencia
sin
fundamento. En secundaria, especificar el nivel,
el
contenido,
el
objetivo
y
el
contexto
de
la
consulta puede favorecer respuestas pertinentes;
esa
competencia
debe
distinguirse
de
la
comprensión
demostrada
sin
asistencia
(Ng
et
al., 2024).
La
formulación
de
instrucciones
se
concibe
como un ciclo iterativo, no como la redacción de
una única pregunta inicial. El ciclo comienza con
el
análisis
de
la
tarea
y
un
intento
propio,
continúa
con
la
comunicación
de
los
datos,
la
incógnita,
las
restricciones
y
el
tipo
de
ayuda
solicitada,
y
se
completa
con
el
examen,
la
reformulación y la verificación de la respuesta.
Para estudiar este proceso conviene codificar la
función
de
cada
consulta
y
diferenciar
las
solicitudes
de
solución
completa,
pistas,
explicación
conceptual,
comprobación
de
un
paso,
comparación
de
métodos,
generación
de
contraejemplos y análisis de errores.
También deben registrarse la especificidad de la
instrucción,
el
número
y
la
dirección
de
sus
revisiones,
la
presencia
de
justificaciones
propias y la decisión final de aceptar, modificar
o
rechazar
la
salida.
La
extensión
o
la
sofisticación
lingüística
de
la
instrucción
no
constituyen
por
sí
solos
indicadores
de
competencia:
una
consulta
eficaz
para
obtener
una respuesta puede externalizar las operaciones
intelectuales que el estudiante debería aprender a
realizar. La calibración metacognitiva se define
como
la
correspondencia
entre
el
grado
de
confianza del estudiante y la corrección objetiva
de su razonamiento. La sobre confianza aparece
cuando se atribuye alta
certeza
a una solución
incorrecta; la infra confianza, cuando se duda de
una respuesta correcta. En una interacción con
IAG
deben
distinguirse
dos
objetos
de
calibración: la confianza en la solución propia y
la confianza depositada en la salida del sistema.
La
calibración
puede
medirse
mediante
estimaciones
de
confianza
antes
y
después
de
consultar
la
herramienta,
la
diferencia
entre
confianza
y
exactitud,
la
capacidad
de
discriminar respuestas correctas e incorrectas, y
la detección y corrección de errores introducidos
de forma controlada. Este proceso se integra en
una
autorregulación
orientada
a
metas
que
incluye planificar, ejecutar, supervisar, evaluar y
ajustar
estrategias.
La
IAG
puede
apoyarlo
mediante
retroalimentación
contingente
y
preguntas de elaboración, pero la disponibilidad
de indicaciones no demuestra que el estudiante
aplique
una
estrategia
ni
que
pueda
sostenerla
cuando cesa la ayuda (Fütterer et al., 2026).
A
partir
de
estas
definiciones
se
plantean
dos
vías
teóricas.
En
la
vía
de
andamiaje,
el
estudiante realiza un intento, solicita una pista o
explicación, contrasta la respuesta con principios
matemáticos o físicos, corrige el procedimiento
y
reduce
progresivamente
la
ayuda.
La
IAG
distribuye de forma temporal la carga de la tarea
sin sustituir las decisiones centrales. En la vía de
sustitución,
el
estudiante
solicita
o
acepta
una
solución
completa,
interpreta
la
fluidez
verbal
como
garantía
de
verdad
y
reduce
la
recuperación
de
conocimientos,
la
auto
explicación
y
la
comprobación.
Ambas
vías
pueden
producir
un
ejercicio
aparentemente
correcto
durante
la
asistencia,
pero
solo
la
primera
incorpora
mecanismos
plausibles
para
consolidar la autonomía. Las salvaguardas, por
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 865
tanto,
deben
definirse
como
componentes
observables
de
la
intervención:
intento
previo,
pistas
graduadas,
restricción
de
respuestas
directas,
solicitud
de
justificación,
verificación
por
una
segunda
vía,
advertencias
de
incertidumbre
y
supervisión
docente.
La
literatura
K–12
identifica
la
alfabetización
insuficiente, la dependencia y la dificultad para
evaluar contenido erróneo como problemas que
deben examinarse, no como obstáculos resueltos
por la propia tecnología (Zhang et al., 2026).
La
segunda
dimensión
del
marco
es
la
heterogeneidad
por
disciplina,
tarea
y
representación. Esta heterogeneidad no se trata
como ruido estadístico que deba ocultarse bajo
un
promedio
global,
sino
como
una
propiedad
sustantiva
del
fenómeno.
Se
distinguen
la
disciplina y el contenido curricular; la demanda
cognitiva,
ya
sea
procedimental,
conceptual,
argumentativa
o
de
modelización;
el
grado
de
especificación de los datos; el carácter rutinario,
novedoso o abierto del problema; el número de
pasos
y decisiones;
y la representación
verbal,
simbólica,
tabular,
gráfica,
diagramática
o
multimodal.
También se consideran el curso, el conocimiento
previo, el idioma de interacción, el modelo y la
versión utilizados, la interfaz, el nivel de ayuda
permitido
y
la
mediación
docente.
El
efecto
atribuible a la IAG debe interpretarse como una
relación
condicionada
entre
estas
dimensiones,
no
como
una
propiedad
estable
que
pueda
trasladarse de un ejercicio, una asignatura o una
versión del sistema a otra. Las matemáticas y la
física comparten el uso de lenguaje simbólico,
relaciones
cuantitativas
y
procedimientos
de
cálculo, pero no plantean demandas epistémicas
idénticas. En matemáticas, la validez depende de
la
coherencia
de
definiciones,
relaciones
y
demostraciones
dentro
del
sistema
formal.
En
física, la solución también exige representar el
fenómeno,
seleccionar
un
modelo,
declarar
supuestos y juzgar si el resultado es plausible en
el mundo físico.
La
distinción
no
es
absoluta,
porque
la
modelización
matemática
también
conecta
situaciones y estructuras, pero ayuda a explicar
por qué una destreza procedimental en álgebra
no
garantiza
competencia
en
cinemática,
dinámica
o
razonamiento
gráfico.
La
especificación
de
la
tarea
también
resulta
decisiva: un problema con todos los datos orienta
hacia
la
aplicación
de
relaciones
conocidas,
mientras
que
uno
subespecificado
exige
determinar
qué
información
falta
y
qué
estimaciones son admisibles. Las auditorías de
modelos
muestran
que
esta
variación
altera
la
calidad de las soluciones; sin embargo, describen
la
capacidad
del
sistema
y
no
constituyen
evidencia de aprendizaje del alumnado (Wang et
al., 2024).
La representación tampoco constituye un rasgo
superficial. Un enunciado verbal, una ecuación,
una tabla, una gráfica o un diagrama distribuyen
la
información
de
manera
diferente
y
exigen
operaciones
de
traducción
entre
registros.
Una
herramienta
puede
reconocer
una
relación
simbólica
sin
identificar
la
magnitud
representada por la pendiente de una gráfica o
producir
una
descripción
verbal
coherente
sin
integrar restricciones espaciales presentes en un
esquema.
La
evaluación
debe
conservar
la
modalidad
original
de
la
tarea
y
documentar
cualquier
transformación realizada para introducirla en el
sistema, porque convertir una imagen
en texto
puede
modificar
el
constructo
que
se
pretende
medir.
La
dificultad
de
verificación
aumenta
cuando la respuesta combina texto, ecuaciones y
elementos
visuales:
el
alumnado
puede
confirmar
un
cálculo
y
pasar
por
alto
una
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 866
inconsistencia conceptual o gráfica. Por ello, la
disciplina,
la
demanda
cognitiva,
la
especificación
y
la
representación
deben
analizarse
por
separado
y
como
interacciones,
siempre
que
la
cantidad
y
la
calidad
de
los
estudios lo permitan.
La interpretación de los resultados requiere una
jerarquía
explícita
de
medidas.
El
desempeño
durante el uso de la IAG es un resultado proximal
del episodio asistido y describe la eficiencia, la
finalización o la calidad del producto, pero no
basta
para
inferir
aprendizaje.
El
resultado
principal debe ser el desempeño independiente
en una prueba comparable realizada sin IAG. La
comprensión
conceptual
debe
valorar
las
explicaciones, las relaciones entre principios y la
detección
de
errores;
la
transferencia,
la
aplicación
a
problemas
nuevos,
con
distinción
entre
transferencia
cercana
y
lejana;
y
la
retención,
la
conservación
del
aprendizaje
mediante una medición demorada. Las medidas
auto
informadas
de
motivación,
utilidad
o
confianza
describen
la
experiencia
del
estudiante, pero no reemplazan los indicadores
objetivos
ni
demuestran
calibración.
Además,
los efectos deben desagregarse por contenido y
grado
de
integración
pedagógica,
porque
la
síntesis
de
la
investigación
matemática
indica
que
estas
características
pueden
modificar
las
estimaciones y volver engañosa una conclusión
indiferenciada (Liu et al., 2026).
Estas dos dimensiones son complementarias. La
alfabetización en IA, la formulación iterativa de
instrucciones
y
la
calibración
metacognitiva
explican
cómo
se
desarrolla
la
interacción;
la
disciplina,
la
demanda
de
la
tarea,
su
especificación
y
su
representación
delimitan
dónde puede variar el efecto. Como muestra la
Figura
1,
ambos
conjuntos
de
condiciones
influyen
en
el
ciclo
de
intento,
consulta,
evaluación y revisión, pero el resultado asistido
solo
adquiere
significado
educativo
cuando
se
contrasta con una evaluación sin IAG.
Este marco orienta la comparación entre el apoyo
directo de la IAG y la enseñanza o práctica sin
IAG,
las
herramientas
no
generativas
o
las
configuraciones
alternativas
en
estudiantes
de
secundaria
ISCED
2
y
3.
Los
resultados
de
interés
son
el
desempeño
independiente,
la
comprensión
conceptual,
la
transferencia
y
la
retención.
También
guía
dos
análisis:
si
la
alfabetización,
la
verificación
y
la
calibración
modifican el aprendizaje autónomo frente al uso
no estructurado, y cómo varían los efectos según
la
disciplina,
la
demanda
cognitiva,
la
especificación,
la
representación,
el
curso,
el
modelo, la mediación docente y el seguimiento.
Figura 1.
Modelo conceptual de la interacción
entre alfabetización en IA, características de la
tarea y aprendizaje independiente.
Fuente: Elaboración propia.
Materiales y Métodos
Se realizó una revisión sistemática con síntesis
narrativa,
sin
metaanálisis,
para
examinar
el
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 867
efecto del uso directo de la IAG por estudiantes
de
educación
secundaria
ISCED
2–3
en
la
resolución
de
problemas
curriculares
de
matemáticas o física. El informe siguió PRISMA
2020 (Page et al., 2021).
Se incluyeron artículos
originales
en
español
o
inglés
que
informaran
ensayos aleatorizados o diseños comparativos no
aleatorizados;
los
estudios
de
métodos
mixtos
fueron
admisibles
si
aportaban
datos
comparativos.
Los
comparadores
fueron
la
enseñanza o práctica sin IAG, las herramientas
no generativas o las configuraciones alternativas.
Se
exigió
al
menos
un
resultado
objetivo
de
desempeño independiente sin IAG, comprensión
conceptual, transferencia o retención.
Se excluyeron los estudios sin comparador, los
diseños
pretest
–
postest
de
un
solo
grupo,
los
estudios
cualitativos
puros,
las
auditorías
del
modelo sin alumnado, los usos exclusivamente
docentes,
las
muestras
o
asignaturas
no
separables y las publicaciones no originales o sin
texto completo. Se buscaron estudios en ERIC,
Scopus,
Web
of
Science
Core
Collection,
Education Source y APA PsycINFO entre el 1 de
enero de 2020 y el 30 de agosto de 2026. Cuando
la plataforma lo permitió, se aplicaron filtros de
idioma
y
revisión
por
pares,
sin
restringir
el
diseño para preservar la sensibilidad.
Se
combinaron
términos
libres
y
descriptores
controlados
adaptados
a
cada
fuente.
Una
cadena representativa fue: ("
generative AI
"
OR
ChatGPT
OR
"
large
language
model
*"
OR
"inteligencia
artificial
generativa")
AND
(
mathematics
OR
physics
OR
matemáticas
OR
física)
AND
("
secondary education
"
OR
"
middle
school
*"
OR
"
high
school
*"
OR
secundaria)
AND
("
problem solving
"
OR
"
problem-solving
"
OR
"resolución
de
problemas").
También
se
revisaron las referencias y las citas posteriores de
los artículos elegibles. Después de eliminar los
duplicados, dos revisores examinaron de forma
independiente los títulos y resúmenes y, después,
los
textos
completos.
Las
discrepancias
se
resolvieron
por
consenso
o
mediante
un
tercer
revisor. Se registraron los motivos de exclusión,
y el proceso documental disponible se resumió
en
un
flujograma
de
auditoría
previo
al
cierre
PRISMA.
Un formulario previamente probado recogió el
país, el diseño, la muestra, el curso, la disciplina,
el contenido, el modelo y la versión de IAG, el
comparador, la duración, la mediación docente,
las características y la representación de la tarea,
el
momento
de
evaluación
y
los
resultados
asistidos
e
independientes.
Cuando
estuvieron
disponibles,
también
se
extrajeron
los
intentos
previos,
las
instrucciones,
las
comprobaciones,
las revisiones, la transferencia, la retención y las
medidas
de
calibración
metacognitiva.
Dos
revisores
evaluaron
de
forma
independiente
el
riesgo de sesgo por dominios y según el diseño;
resolvieron
las
diferencias
por
consenso
o
mediante un tercer revisor y consideraron esos
juicios al interpretar la síntesis.
Debido
a
la
heterogeneidad
prevista
en
las
intervenciones, las tareas, los comparadores, los
instrumentos y el seguimiento, no se calcularon
estimaciones
combinadas.
La
síntesis
narrativa
siguió criterios de transparencia para revisiones
sin
metaanálisis
(Campbell
et
al.,
2020).
Los
resultados se organizaron por diseño, disciplina,
curso,
demanda
cognitiva,
especificación
y
representación
de
la
tarea,
configuración
de
la
IAG,
mediación
docente,
comparador
y
seguimiento. El desempeño durante la asistencia
se distinguió del desempeño posterior sin IAG;
la comprensión conceptual, la transferencia y la
retención
se
examinaron
por
separado.
La
interpretación
consideró
la
dirección,
la
magnitud
y
la
precisión
de
los
resultados,
así
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 868
como el riesgo de sesgo. No se basó solo en la
significación
estadística
ni
formuló
inferencias
causales que excedieran el diseño.
Resultados y Discusión
La
auditoría
del
corpus
documental
disponible
identificó
17
entradas
bibliográficas,
cinco
de
ellas duplicadas. El corpus quedó constituido por
12 fuentes únicas, no por 17 informes incluidos.
Dos
fuentes
correspondían
a
guías
metodológicas;
las
10
referencias
temáticas
restantes comprendían cuatro estudios primarios
con
estudiantes,
tres
revisiones
o
metaanálisis,
dos auditorías del modelo sin alumnado y una
guía educativa.
De acuerdo con los criterios de elegibilidad, los
cuatro estudios primarios pasaron a evaluación
detallada. La correspondencia con matemáticas
de secundaria fue explícita en Bastani y Xing;
Fütterer
combinó
física
e
inglés,
y
Ng
abordó
fuerza
y
movimiento
dentro
de
ciencias.
La
elegibilidad
definitiva
dependió
de
la
revisión
del texto completo y de la separabilidad de los
resultados.
La
documentación
disponible
no
respaldó
la
cifra
preliminar
de
15
estudios
incluidos,
por
lo
que
no
se
presentó
como
un
resultado PRISMA verificado (Page et al., 2021;
véase la Figura 2).
Figura 2.
Flujograma de auditoría del corpus
documental antes del cierre PRISMA 2020.
Fuente: Elaboración propia.
De los cuatro estudios primarios evaluados, tres
aportaron
hallazgos
comparativos:
un
ensayo
aleatorizado y dos estudios cuasiexperimentales.
Los
estudios
compararon
la
IAG
aplicada
a
matemáticas o física con la práctica sin IAG, un
chatbot
basado en reglas o un grupo de control.
Informaron medidas de desempeño posterior sin
asistencia o de conocimiento inmediato; ninguno
evaluó de forma diferenciada la transferencia ni
la retención (Tabla 1).
Tabla 1.
Características y hallazgos de los estudios primarios.
Estudio
Diseño y población
Comparación y variable
Hallazgo principal
Bastani et al. (2025)
Ensayo aleatorizado por clases;
cerca de mil estudiantes de los
grados 9.º a 11.º en matemáticas.
Chatbo
t abierto, tutor generativo
con salvaguardas y práctica
habitual; rendimiento asistido y
examen sin IAG.
La práctica mejoró un 48 % y un 127 %;
sin asistencia, el
chatbot
abierto obtuvo
un rendimiento 17 % inferior y el tutor
no difirió del control.
Ng et al. (2024)
Cuasiexperimento de tres semanas;
74 estudiantes de cuarto curso de
secundaria de Hong Kong.
Chatbot
autorregulatorio
generativo frente a
chatbot
basado en reglas; conocimiento
de fuerza y movimiento.
El
chatbot
generativo superó al reglado
en conocimiento posprueba (U = 462.5, p
= .02, r = .35).
Xing et al. (2025)
Fase cuasiexperimental
pretest–
postest
; 212 estudiantes de sexto a
octavo grado de un distrito escolar
del sureste de Estados Unidos.
ALTER-Math frente a Math
Nation; conocimiento matemático
antes y después de la
intervención.
ALTER-Math produjo una mejora
significativamente mayor del
conocimiento matemático que Math
Nation sin el agente generativo.
Fuente: Elaboración propia.
Se
examinó
si
la
formación
y
la
mediación
docente modificaron el uso real de la IAG y el
aprendizaje
independiente
en
secundaria.
Se
identificaron
tres
estudios
primarios
sobre
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 869
docentes de matemáticas, pero ninguno incluyó
un comparador causal ni resultados estudiantiles
sin
asistencia.
Por
ello,
se
conservaron
como
evidencia
contextual;
la
Figura
3
resume
su
alcance y
el
eslabón no evaluado (Atuahene
y
Boateng, 2026; Busuttil y Calleja, 2025; Trung
et al., 2025).
Figura 3.
Alcance de la evidencia docente sobre
integración
de
ChatGPT
y
aprendizaje
independiente en matemáticas de secundaria.
Fuente: Elaboración propia.
Se examinó cuándo la actividad observable con
IAG
reflejó
esfuerzo
cognitivo
productivo
y
cuándo
coincidió
con
sustitución
o
búsqueda
superficial de respuestas. Se identificaron cuatro
estudios
primarios
sobre
matemáticas,
física
o
ciencias afines en secundaria. Ninguno cumplió
simultáneamente el requisito de comparador y la
medición objetiva posterior sin IAG establecidos
en el protocolo; por ello, se conservaron como
evidencia contextual y no se integraron en una
estimación causal (Inowe, 2025; Lintner et al.,
2026; Lnenicka y Coufal, 2026; Pan et al., 2026).
La Figura 4 sintetiza la dirección de los hallazgos
sin equiparar escalas ni diseños. Los marcadores
distinguen cambios o asociaciones compatibles
con
participación
productiva,
resultados
sin
cambio
claro
y
señales
de
sustitución.
La
representación
no
atribuye
causalidad
a
encuestas
transversales
ni
a
estudios
pretest–
postest
sin grupo de control.
Figura 4.
Dirección de la evidencia contextual
sobre
participación
productiva
y
sobre
dependencia
en
matemáticas
y
física
de
secundaria.
Fuente: Elaboración propia.
La
evidencia
disponible
no
respalda
una
conclusión uniforme sobre el efecto de la IAG en
el
aprendizaje
de
matemáticas
y
física
en
secundaria.
Se
observaron
mejoras
durante
la
práctica o en el conocimiento inmediato cuando
el
apoyo
estuvo
estructurado,
pero
esos
resultados no demostraron de forma consistente
desempeño
independiente,
comprensión
conceptual, transferencia o retención después de
retirar la herramienta (Bastani et al., 2025; Liu et
al., 2026; Ng et al., 2024; Xing et al., 2025). Este
patrón
indica
que
la
corrección
del
producto
asistido
no
puede
equipararse
con
la
competencia que el estudiante conserva y aplica
por sí mismo. La diferencia puede interpretarse
mediante dos vías: andamiaje y sustitución. En la
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 870
primera, el estudiante realiza un intento, recibe
una
pista,
contrasta
principios
y
revisa
su
procedimiento;
en
la
segunda,
acepta
una
solución completa y externaliza las operaciones
que
debería
aprender
a
ejecutar.
Las
salvaguardas
redujeron
el
perjuicio
observado
con el acceso abierto, pero no demostraron una
ventaja
autónoma.
Los
apoyos
orientados
a
la
autorregulación o al aprendizaje por enseñanza
ofrecieron
señales
favorables
sin
aislar
con
certeza
el
componente
responsable
(Bastani
et
al., 2025; Fütterer et al., 2026; Ng et al., 2024;
Xing et al., 2025). El efecto educativo, por tanto,
parece depender de la configuración de la ayuda,
la
exigencia
de
elaboración
y
la
mediación
pedagógica,
no
de
la
mera
disponibilidad
del
sistema.
La
interpretación
también
depende
de
la
disciplina,
la
demanda
cognitiva,
la
especificación del problema y la representación
utilizada. Las auditorías mostraron que la calidad
de
las
respuestas
variaba
ante
tareas
subespecificadas
y
que
el
sistema
podía
reproducir
razonamientos
propios
de
un
principiante;
esos
estudios,
sin
embargo,
evaluaron
el
modelo
y
no
el
aprendizaje
del
alumnado
(Kortemeyer,
2023;
Wang
et
al.,
2024).
Los
resultados
obtenidos
en
ejercicios
procedimentales
no
deben
generalizarse
automáticamente
a
la
modelización,
el
razonamiento gráfico o los problemas abiertos,
ni
debe
asumirse
que
la
fluidez
de
una
explicación
garantiza
su
exactitud
conceptual.
Los hallazgos sobre motivación, participación y
autorregulación
fueron
heterogéneos.
Una
intervención generativa mostró ventajas frente a
un chatbot basado en reglas, pero otros apoyos
no
superaron
de
forma
consistente
el
uso
estándar de ChatGPT en esfuerzo, conocimiento
disciplinar o estrategias de elaboración (Fütterer
et
al.,
2026;
Ng
et
al.,
2024).
La
evidencia
contextual
describió
usos
compatibles
con
la
elaboración y la verificación, así como patrones
de sustitución, copia o dependencia; sus diseños
transversales o sin grupo de control impidieron
establecer la dirección causal de esas relaciones
(Inowe, 2025; Lintner et al., 2026; Lnenicka y
Coufal,
2026;
Pan
et
al.,
2026).
Las
disposiciones
docentes
favorables
coexistieron
con
necesidades
de
formación,
tiempo
e
infraestructura, sin demostrar que la capacitación
modificara
el
aprendizaje
independiente
del
alumnado (Atuahene y Boateng, 2026; Busuttil y
Calleja, 2025; Trung et al., 2025).
Respecto
de
la
validez
de
la
evaluación
y
la
integridad
académica,
la
evidencia
incluida
no
permitió
establecer
qué
rediseños
preservan
mejor
la
interpretación
del
desempeño
individual.
La
capacidad
del
modelo
para
responder
tareas
académicas
convencionales,
junto con la disociación observada entre práctica
asistida y examen sin ayuda, limita el valor de un
producto
no
supervisado
como
indicador
de
dominio; esto amenaza la inferencia evaluativa,
pero
no
demuestra
de
forma
automática
una
conducta
indebida
(Bastani
et
al.,
2025;
Kortemeyer, 2023).
La resolución supervisada, la justificación oral,
la evidencia del proceso, la declaración del tipo
de asistencia y las pruebas posteriores sin acceso
a la herramienta son opciones plausibles que aún
deben
compararse
empíricamente
(Miao
y
Holmes, 2023). La gobernanza, la privacidad y
la reproducibilidad contaron con evidencia aún
más
escasa,
pues
el
corpus
no
aportó
estudios
directos
sobre
incidentes,
consentimiento
de
menores,
flujos
de
datos
o
cumplimiento
institucional
en
esta
población.
Las
revisiones
disponibles
señalaron
problemas
de
transparencia,
privacidad
y
preparación
tecnológica,
pero
no
permitieron
estimar
su
frecuencia
ni
sus
consecuencias
educativas
(Alfarwan,
2025;
Zhang
et
al.,
2026).
La
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 871
ausencia
de
datos
no
demuestra
seguridad
ni
daño.
Una
intervención
reproducible
debe
documentar
el
modelo,
la
versión,
la
fecha
de
acceso,
la
interfaz,
la
configuración,
las
instrucciones,
la
dosis
y
las
modificaciones,
además
del
consentimiento,
la
supervisión
humana y las medidas de protección aplicables a
menores (Miao y Holmes, 2023).
La interpretación de los hallazgos está limitada
por
la
escasez
de
estudios
comparativos
directamente
pertinentes,
la
brevedad
de
las
intervenciones
y
la
diversidad
de
poblaciones,
comparadores,
tareas,
configuraciones
e
instrumentos.
Los
estudios
contextuales
ampliaron
la
comprensión
de
los
usos
reales,
pero sus medidas autoinformadas y diseños no
controlados
impiden
atribuir
efectos
a
la
herramienta. Tampoco se dispuso de evidencia
suficiente
sobre
transferencia,
retención,
equidad, rediseño evaluativo o gobernanza, ni de
una valoración formal de la certeza. La ausencia
de una síntesis cuantitativa y la prudencia de las
conclusiones
están,
por
tanto,
metodológicamente justificadas (Campbell et al.,
2020).
Entre las fortalezas de la revisión se encuentran
la
delimitación
explícita
de
la
población,
la
intervención, los comparadores, los resultados y
el
seguimiento;
la
prioridad
concedida
a
resultados
objetivos
sin
asistencia;
y
la
separación
entre
evidencia
comparativa
y
contextual,
en
concordancia
con
una
síntesis
narrativa
transparente
(Campbell
et
al.,
2020;
Page et al., 2021). La restricción idiomática, el
flujo
documental
todavía
no
conciliado,
la
separabilidad incierta de algunos resultados por
disciplina y la ausencia de una valoración formal
de la certeza reducen, no obstante, la completitud
de
la
revisión
y
obligan
a
considerar
provisionales
sus
conclusiones.Se
requieren
estudios
prerregistrados
que
comparen
configuraciones
abiertas
y
salvaguardadas,
midan
el
desempeño
sin
asistencia,
la
transferencia
y
la
retención,
y
documenten
la
fidelidad,
la
contaminación,
la
equidad
y
la
gobernanza.
Hasta
que
se
disponga
de
esa
evidencia,
la
IAG
debería
utilizarse
como
andamiaje verificable y
de retirada progresiva,
no
como
sustituto
del
razonamiento
ni
como
evidencia automática de competencia individual,
con preservación de la agencia y la protección
del alumnado (Miao y Holmes, 2023; Zhang et
al., 2026).
Conclusiones
En
estudiantes
de
educación
secundaria
que
emplearon
IAG
para
resolver
problemas
de
matemáticas
o
física,
la
evidencia
revisada
no
permitió establecer un beneficio uniforme para el
aprendizaje
independiente.
El
apoyo
estructurado mostró señales favorables
durante
la práctica o en el conocimiento inmediato, pero
la entrega abierta de soluciones pudo mejorar el
producto asistido sin asegurar que el desempeño
se mantuviera al retirar la herramienta. Su valor
educativo
depende,
por
ello,
de
que
funcione
como
andamiaje
para
analizar,
justificar
y
verificar, no como sustituto del razonamiento del
estudiante.
Estas conclusiones son provisionales debido a la
escasez de
estudios comparativos directamente
pertinentes, la brevedad de las intervenciones y
la
heterogeneidad
de
poblaciones,
disciplinas,
tareas,
configuraciones,
comparadores
e
instrumentos.
La
evidencia
sobre
motivación,
autorregulación
y
mediación
docente
fue
principalmente contextual y no permitió atribuir
efectos causales. La transferencia, la retención,
la
equidad,
el
rediseño
de
la
evaluación,
la
privacidad
y
la
gobernanza
permanecieron
insuficientemente
estudiados.
La
ausencia
de
una
valoración
formal
de
la
certeza
y
las
inconsistencias pendientes en la delimitación del
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 872
corpus también restringen la interpretación. Si se
incorpora
en
la
práctica
educativa,
conviene
exigir
un
intento
previo,
proporcionar
pistas
graduadas,
solicitar
justificaciones
y
comprobaciones
independientes,
y
retirar
progresivamente
la
ayuda
bajo
mediación
docente. La evaluación del aprendizaje debería
priorizar el proceso, la resolución supervisada y
el
desempeño
posterior
sin
asistencia.
Las
instituciones,
a
su
vez,
deben
documentar
el
modelo, la versión, la configuración y los flujos
de
datos,
y
proteger
la
información
de
los
menores.
La
investigación
futura
debe
comparar
configuraciones
abiertas
y
salvaguardadas
mediante estudios prerregistrados que midan la
comprensión
conceptual,
la
transferencia,
la
retención, la detección de errores y la calibración
metacognitiva,
además
de
la
fidelidad,
la
contaminación y los efectos diferenciales entre
grupos. Hasta disponer de evidencia más sólida,
la IAG debe considerarse un apoyo pedagógico
condicionado y verificable, no una garantía de
aprendizaje
ni
una
evidencia
automática
de
competencia individual.
Referencias Bibliográficas
Alfarwan, A. (2025). Generative AI use in K-12
education: A systematic review.
Frontiers in
Education
,
10
,
Article
1647573.
https://doi.org/10.3389/feduc.2025.1647573
Atuahene,
E.,
&
Boateng,
F.
O.
(2026).
Mathematics
teachers’
awareness,
perceptions, and challenges in using ChatGPT.
Discover
Education
,
5
,
Article
88.
https://doi.org/10.1007/s44217-025-01083-4
Bastani,
H.,
Bastani,
O.,
Sungu,
A.,
Ge,
H.,
Kabakcı,
Ö.,
&
Mariman,
R.
(2025).
Generative
AI
without
guardrails
can
harm
learning:
Evidence
from
high
school
mathematics.
Proceedings
of
the
National
Academy
of
Sciences
,
122
(26),
Article
e2422633122.
https://doi.org/10.1073/pnas.2422633122
Busuttil,
L.,
&
Calleja,
J.
(2025).
Teachers’
beliefs
and
practices
about
the
potential
of
ChatGPT
in
teaching
mathematics
in
secondary
schools.
Digital
Experiences
in
Mathematics
Education
,
11
,
140–166.
https://doi.org/10.1007/s40751-024-00168-3
Campbell,
M.,
McKenzie,
J.
E.,
Sowden,
A.,
Katikireddi,
S.
V.,
Brennan,
S.
E.,
Ellis,
S.,
Hartmann-Boyce, J., Ryan, R., Shepperd, S.,
Thomas, J., Welch, V., & Thomson, H. (2020).
Synthesis
without
meta-analysis
(SWiM)
in
systematic reviews: Reporting guideline.
BMJ
,
368
,
Article
l6890.
https://doi.org/10.1136/bmj.l6890
Casal-Otero, L., Catala, A., Fernández-Morante,
C.,
Taboada,
M.,
Cebreiro,
B.,
&
Barro,
S.
(2023).
AI
literacy
in
K-12:
A
systematic
literature
review.
International
Journal
of
STEM
Education
,
10
,
Article
29.
https://doi.org/10.1186/s40594-023-00418-7
Fütterer, T., Bardach, L., Kuhn, J., Keller, S. D.,
&
Gerjets,
P.
(2026).
Enhancing
school
students’
self-regulated
learning
through
generative
AI
support:
A
randomized
controlled
trial.
Educational
Psychology
Review
,
38
,
Article
42.
https://doi.org/10.1007/s10648-026-10133-8
Inowe,
Z.
N.
(2025).
ChatGPT
on
STEM
12
students’ perception, motivation, engagement
and
understanding
graphs
in
kinematics:
An
exploration.
International Journal of Research
and Innovation in Social Science
,
9
(7), 2283–
2314.
https://doi.org/10.47772/IJRISS.2025.907000
188
Kortemeyer,
G.
(2023).
Could
an
artificial-
intelligence agent pass an introductory physics
course?
Physical
Review
Physics
Education
Research
,
19
(1),
Article
010132.
https://doi.org/10.1103/PhysRevPhysEducRes
.19.010132
Lintner, T., Juhaňák, L., Žáková, M., Plch, L., &
Ropovik,
I.
(2026).
Generative
AI
use
and
academic
achievement:
A
cross-sectional
study
of
Czech
seventh-grade
students.
Education
and
Information
Technologies
,
Advance
online
publication.
https://doi.org/10.1007/s10639-026-14002-3
Liu,
B.,
Zhang,
W.,
&
Wang,
F.
(2026).
Can
generative
artificial
intelligence
effectively
enhance
students’
mathematics
learning
outcomes?—A
meta-analysis
of
empirical
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 873
studies
from
2023
to
2025.
Education
Sciences
,
16
(1),
Article
140.
https://doi.org/10.3390/educsci16010140
Lnenicka, M., & Coufal, P. (2026). Navigating
AI
in
STEM:
What
secondary
students
actually
do
with
generative
AI-driven
tools.
International Journal of STEM Education
,
13
,
Article
36.
https://doi.org/10.1186/s40594-
026-00637-8
Martin, F., Zhuang, M., & Schaefer, D. (2024).
Systematic
review
of
research
on
artificial
intelligence
in
K-12
education
(2017–2022).
Computers
and
Education:
Artificial
Intelligence
,
6
,
Article
100195.
https://doi.org/10.1016/j.caeai.2023.100195
Miao, F., & Holmes, W. (2023).
Guidance for
generative
AI
in
education
and
research.
UNESCO.
https://doi.org/10.54675/EWZM9535
Ng,
D.
T.
K.,
Tan,
C.
W.,
&
Leung,
J.
K.
L.
(2024).
Empowering
student
self-regulated
learning
and
science
education
through
ChatGPT:
A
pioneering
pilot
study.
British
Journal
of
Educational
Technology
,
55
(4),
1328–1353.
https://doi.org/10.1111/bjet.13454
Page,
M.
J.,
McKenzie,
J.
E.,
Bossuyt,
P.
M.,
Boutron, I., Hoffmann, T. C., Mulrow, C. D.,
Shamseer,
L.,
Tetzlaff,
J.
M.,
Akl,
E.
A.,
Brennan,
S.
E.,
Chou,
R.,
Glanville,
J.,
Grimshaw, J. M., Hróbjartsson, A., Lalu, M.
M.,
Li,
T.,
Loder,
E.
W.,
Mayo-Wilson,
E.,
McDonald,
S.,
…
Moher,
D.
(2021).
The
PRISMA
2020
statement:
An
updated
guideline
for
reporting
systematic
reviews.
BMJ
,
372
,
Article
n71.
https://doi.org/10.1136/bmj.n71
Pan,
E.
Z.,
Glick,
D.,
&
Xu,
Y.
(2026).
How
motivation
relates
to
generative
AI
use:
A
large-scale
survey
of
Mexican
high
school
students
[Preprint].
arXiv.
https://doi.org/10.48550/arXiv.2603.19263
Trung, L. T. B. T., Thanh Trung, T., & Dung, T.
M.
(2025).
ChatGPT
in
Vietnamese
math
classrooms: What are the influencing factors
behind
teachers’
adoption?
Journal
of
Pedagogical
Research
,
9
(2),
72–88.
https://doi.org/10.33902/JPR.202531924
Wang,
K.
D.,
Burkholder,
E.,
Wieman,
C.,
Salehi, S., & Haber, N. (2024). Examining the
potential
and
pitfalls
of
ChatGPT
in
science
and engineering problem-solving.
Frontiers in
Education
,
8
,
Article
1330486.
https://doi.org/10.3389/feduc.2023.1330486
Xing, W., Song, Y., Li, C., Liu, Z., Zhu, W., &
Oh, H. (2025). Development of a generative
AI-powered teachable agent for middle school
mathematics
learning:
A
design-based
research study.
British Journal of Educational
Technology
,
56
(5),
2043–2077.
https://doi.org/10.1111/bjet.13586
Yusuf, A., Pervin, N., Román-González, M., &
Noor,
N.
M.
(2024).
Generative
AI
in
education and research: A systematic mapping
review.
Review
of
Education
,
12
(2),
Article
e3489.
https://doi.org/10.1002/rev3.3489
Zhang,
P.,
&
Tur,
G.
(2024).
A
systematic
review
of
ChatGPT
use
in
K-12
education.
European Journal of Education
,
59
(2), Article
e12599.
https://doi.org/10.1111/ejed.12599
Zhang, T., Lai, Y. C., & Yu, P. L. H. (2026).
Generative
artificial
intelligence
in
K-12
education: A systematic review.
Research and
Practice
in
Technology
Enhanced
Learning
,
21
,
Article
34.
https://doi.org/10.58459/rptel.2026.21034
Zhao, J., Chapman, E., & Ghassemi Pour Sabet,
P.
(2024).
Generative
AI
and
educational
assessments: A systematic review.
Education
Research
&
Perspectives
,
51
,
124–155.
https://doi.org/10.70953/ERPv51.2412006
Esta
obra
está
bajo
una
licencia
de
Creative Commons Reconocimiento-No Comercial 4.0
Internacional.
Copyright
©
Luis
Teodoro
Zambrano
Rodríguez,
Hansel
Francisco
Camacho
Vega,
Marlon
Mauricio
Mayea
Macias
y
Jessenia
Rosario
Vela
Aguilar.
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 874
Declaraciones éticas y editoriales del artículo
Contribución de los autores (Taxonomía CRediT).
Luis Teodoro Zambrano Rodríguez: conceptualización de la investigación, diseño metodológico, desarrollo del proceso investigativo, análisis formal
de los datos, redacción del borrador original del manuscrito, revisión crítica del contenido científico y supervisión general del estudio.
Hansel Francisco Camacho Vega: conceptualización de la investigación, diseño metodológico, desarrollo del proceso investigativo, análisis formal de
los datos, redacción del borrador original del manuscrito, revisión crítica del contenido científico y supervisión general del estudio.
Marlon Mauricio Mayea Macias: conceptualización de la investigación, diseño metodológico, desarrollo del proceso investigativo, análisis formal de
los datos, redacción del borrador original del manuscrito, revisión crítica del contenido científico y supervisión general del estudio.
Jessenia Rosario Vela Aguilar: conceptualización de la investigación, diseño metodológico, desarrollo del proceso investigativo, análisis formal de los
datos, redacción del borrador original del manuscrito, revisión crítica del contenido científico y supervisión general del estudio.
Declaración de conflicto de intereses
Los autores declaran que no existe conflicto de intereses en relación con la investigación presentada, la autoría del manuscrito ni la publicación del
presente artículo.
Declaración de financiamiento
La presente investigación no recibió financiamiento específico de agencias públicas, comerciales o de organizaciones sin fines de lucro. En caso de
existir financiamiento institucional o externo, este deberá ser declarado explícitamente por los autores en esta sección.
Declaración del editor
El editor responsable certifica que el proceso editorial del presente artículo se desarrolló conforme a los principios de integridad científica, transparencia
y buenas prácticas
editoriales.
El
manuscrito
fue
sometido
a un proceso de
evaluación
mediante
revisión por
pares
doble ciego, garantizando
la
confidencialidad de la identidad de los autores y revisores durante todo el proceso de dictamen académico. Asimismo, el editor declara que el artículo
cumple con los criterios científicos, metodológicos y éticos establecidos por la revista.
Declaración de los revisores
Los revisores externos que participaron en la evaluación del presente manuscrito declaran haber realizado el proceso de revisión de manera objetiva,
independiente y confidencial. Asimismo, manifiestan que no mantienen conflictos de interés con los autores ni con la investigación evaluada, y que sus
observaciones y recomendaciones se fundamentan exclusivamente en criterios científicos, metodológicos y académicos.
Declaración ética de la investigación
Los autores declaran que la investigación se desarrolló respetando los principios éticos de la investigación científica, garantizando la confidencialidad
de los datos y el respeto a los participantes del estudio. En los casos en que la investigación involucre seres humanos, los procedimientos deben ajustarse
a los principios éticos establecidos en la Declaración de Helsinki y a las normativas institucionales correspondientes.
Declaración sobre el uso de inteligencia artificial
Los autores declaran que el uso de herramientas de inteligencia artificial, en caso de haberse utilizado durante el proceso de investigación o redacción
del manuscrito, se realizó únicamente como apoyo técnico para mejorar la claridad del lenguaje o el análisis de información, manteniendo siempre la
responsabilidad intelectual sobre el contenido del artículo. Las herramientas de inteligencia artificial no fueron utilizadas como autoras del manuscrito
ni sustituyen la responsabilidad académica de los investigadores.
Disponibilidad de datos
Los datos que respaldan los resultados de esta investigación estarán disponibles previa solicitud razonable al autor de correspondencia, respetando las
normas éticas y de confidencialidad establecidas por la investigación.
Ciencia y Educación
(L-ISSN: 2790-8402 E-ISSN: 2707-3378)
Vol. 7 No. 9.1
Edición Especial IX 2026
Página 875