Logo Passei Direto
Buscar

TCC Fianl - RFID - Copia

Ferramentas de estudo

Mês do Cliente Passei Direto

Quer receber 70% de desconto para assinar o PasseIA?

Material
páginas com resultados encontrados.
páginas com resultados encontrados.

Prévia do material em texto

Trabalho de Conclusão de Curso apresentado para obtenção do título de especialista em Gestão de Negócios Digitais e IA – 2026 
Dados RFID de provadores no varejo de moda para recomendação com preservação da privacidade
1* Titulação. Nome da Empresa ou Instituição (opcional). E-mail autor correspondente: nome@email.com
2 Titulação. Nome da Empresa ou Instituição (opcional). E-mail: nome@email.com
Dados RFID de provadores no varejo de moda para recomendação com preservação da privacidade
Resumo
A digitalização do varejo de moda ampliou a coleta de informações sobre o consumidor e intensificou a tensão entre personalização e proteção de dados pessoais. Nesse contexto, provadores equipados com leitores de identificação por radiofrequência registraram os produtos experimentados antes da compra, fonte de informação ainda pouco explorada para gerar inteligência comercial. Este estudo avaliou em que medida esses registros permitiram gerar recomendações de produtos sem identificação individual do consumidor e propôs um framework de uso orientado à minimização de dados pessoais. Utilizaram-se três bases públicas de um varejista internacional, compostas por sessões de provador e por cestas de vendas físicas e eletrônicas. Após o tratamento dos dados, caracterizaram-se as sessões, estimaram-se suporte, confiança e lift entre categorias e produtos e compararam-se as associações da experimentação com as das compras. A capacidade de recomendação foi avaliada por meio de uma tarefa de conclusão de sessão, em cinco partições, comparando-se modelos de popularidade, lift e confiança em três níveis de detalhamento. As sessões de provador apresentaram composição distinta das cestas de venda e associações que não se reproduziram no ambiente de compra. No nível de produto anônimo, a ordenação por confiança superou de maneira expressiva a referência de popularidade, enquanto a repetição de itens dentro da sessão não acrescentou capacidade preditiva. A sessão anônima conteve, portanto, informação suficiente para sustentar recomendação contextual. O ganho analítico dependeu do detalhamento do produto, e não da identificação da pessoa.
Palavras-chave: análise de cesta de mercado; regras de associação; minimização de dados; proteção de dados pessoais; experimentação de produtos.
Introdução
O varejo de moda atua em um ambiente no qual canais físicos e digitais se integram de forma crescente, enquanto mudanças no comportamento do consumidor ampliam a necessidade de decisões baseadas em dados. O relatório “The State of Fashion 2025” destaca que a indústria enfrenta maior sensibilidade dos consumidores e pressão por novas fontes de crescimento, contexto em que tecnologias capazes de ampliar o conhecimento sobre a experiência de compra ganham relevância (McKinsey & Company e The Business of Fashion, 2024). Nesse cenário, a tecnologia assume papel crescente na compreensão e no atendimento das necessidades dos consumidores (Kotler et al., 2021).
Entre as tecnologias aplicadas ao varejo, a identificação por radiofrequência [RFID] permite identificar produtos individualmente por meio de etiquetas e leitores capazes de registrar sua presença sem contato visual direto. No varejo de moda, sua aplicação concentra-se historicamente no controle de estoques, rastreamento de mercadorias e integração de operações omnichannel, contribuindo para ampliar a visibilidade dos itens ao longo da operação (Ovezmyradov e Kurata, 2022).
A infraestrutura de RFID, entretanto, também permite gerar informações relacionadas à interação entre consumidores e produtos no ambiente físico. Tecnologias inteligentes presentes nas lojas de moda ampliam as possibilidades de conexão entre varejista e consumidor, incorporando recursos digitais à experiência presencial e criando novas fontes de informação para decisões comerciais (Chang et al., 2024). Assim, o produto deixa de gerar dados apenas quando é vendido e passa a produzir registros em etapas anteriores da decisão de compra.
Essa possibilidade torna-se evidente em provadores equipados com leitores RFID, nos quais os produtos presentes em cada sessão podem ser registrados automaticamente. Wölbitsch et al. (2020) utilizaram esse tipo de informação para analisar produtos experimentados conjuntamente e identificaram diferenças entre as composições das sessões de provador e das cestas de vendas. Dessa forma, os dados de experimentação acrescentam uma dimensão que a transação de venda, isoladamente, não registra: a interação com produtos considerados antes da compra.
A transformação desses registros em inteligência depende de métodos capazes de identificar relações entre os itens e gerar sugestões a partir dos padrões encontrados. Sistemas de recomendação utilizam informações sobre produtos e interações para ordenar alternativas consideradas relevantes em determinado contexto, podendo operar a partir de diferentes níveis de informação e de distintas técnicas de associação (Jannach et al., 2022). Nesse sentido, dados de sessões podem sustentar recomendações baseadas na ocorrência conjunta de itens, sem exigir necessariamente um histórico individual do consumidor (Ricci et al., 2022).
Essa possibilidade também se relaciona à discussão sobre privacidade, pois estratégias de personalização frequentemente utilizam informações individuais para aumentar a precisão das recomendações. A percepção sobre o uso desses dados influencia a reação dos consumidores às tecnologias de personalização, especialmente quando surgem preocupações relacionadas ao controle das informações pessoais (Cai e Mardani, 2023). Ao mesmo tempo, abordagens orientadas à minimização demonstram que sistemas de recomendação podem buscar utilidade analítica limitando a quantidade de dados pessoais coletados ou processados (Eichinger e Küpper, 2024).
Nesse contexto, permanece uma oportunidade de investigação nos dados produzidos pelos provadores RFID. Embora Wölbitsch et al. (2020) tenham analisado as sessões de experimentação, os autores não utilizaram essa base nos experimentos de recomendação devido à baixa sobreposição dos códigos de produtos com as bases de vendas. Essa limitação decorre do objetivo de transferir informação entre diferentes ambientes, mas não impede a análise das relações existentes dentro das próprias sessões de provador, nas quais a recomendação pode ser avaliada sem vincular os registros a consumidores identificados.
Diante disso, este estudo tem como objetivo avaliar em que medida dados de experimentação capturados por provadores equipados com RFID permitem gerar recomendações de produtos sem identificação individual do consumidor, considerando diferentes níveis de detalhamento dos dados, e propor um framework de uso orientado à privacidade. 
Metodologia
A pesquisa apresentou abordagem quantitativa e aplicada e utilizou dados secundários de acesso público. Esse delineamento foi adotado porque o objetivo consistiu em mensurar padrões de associação e capacidade de recomendação a partir de registros previamente coletados em ambiente de varejo, sem realização de entrevistas, questionários ou intervenção com consumidores. O emprego de dados secundários permitiu analisar fenômenos já registrados de forma estruturada, conforme a aplicação desse tipo de fonte em pesquisas quantitativas (Gil, 2019).
Foram utilizados os três conjuntos de dados disponibilizados no estudo Mind the Gap, provenientes de um varejista internacional de moda não identificado. A primeira base reuniu vendas realizadas no comércio eletrônico, enquanto a segunda contemplou transações de 112 lojas físicas no mesmo país, ambas coletadas entre 10 de junho e 26 de setembro de 2019. A terceira base correspondeu a sessões de cinco provadores equipados com leitores RFID em uma única loja, coletadas entre dezembro de 2016 e março de 2018, em região distinta daquela das bases de vendas (Wölbitsch et al., 2020).
A estrutura disponibilizada publicamente apresentou três variáveis: TransactionId, utilizada para agrupar os registros pertencentes à mesmacesta ou sessão; ProductId, correspondente ao código anonimizado do produto; e ProductType, que classificou os itens em oito tipos: Accessories, Footwear, Others, Pants, Shirts, Socks, Tops e Underwear. O TransactionId não representou um consumidor e não permitiu acompanhar uma mesma pessoa entre diferentes sessões, ao passo que o ProductId identificou apenas o produto, sem nome, preço, cor, tamanho ou qualquer atributo pessoal associado.
Não foram disponibilizadas informações sobre bairro, cidade ou identificação individual das lojas no conjunto público. Por essa razão, não se realizaram comparações geográficas. A dimensão espacial permaneceu limitada à informação apresentada pelos autores de que as vendas físicas e online pertenciam à mesma região geográfica, enquanto o piloto dos provadores ocorreu em outra região (Wölbitsch et al., 2020).
A base original continha 1.119.570 cestas online, 2.080.072 cestas de lojas físicas e 32.279 sessões de provador. Para reduzir registros considerados atípicos, excluíram-se as cestas com mais de 20 itens, seguindo o mesmo critério utilizado no estudo de origem. Esse tratamento retirou 0,64% das cestas online, 0,18% das vendas físicas e 24,28% das sessões de provador, sendo a proporção mais elevada nos provadores relacionada pelos autores ao uso eventual das cabines para movimentação temporária de mercadorias (Wölbitsch et al., 2020).
Tabela 1. Caracterização das bases utilizadas na pesquisa
	Base
	Período de origem
	Abrangência
	Cestas ou sessões originais
	Exclusão >20 itens
	Vendas online
	jun.–set. 2019
	Comércio eletrônico
	1.119.570
	0,64%
	Vendas físicas
	jun.–set. 2019
	112 lojas
	2.080.072
	0,18%
	Provador RFID
	dez. 2016–mar. 2018
	5 provadores de uma loja
	32.279
	24,28%
Fonte: Dados originais da pesquisa
As ocorrências repetidas de um mesmo ProductId dentro de uma sessão foram preservadas. Essa decisão evitou classificar automaticamente a repetição como erro de leitura, uma vez que o estudo original relatou ocorrências repetidas de produtos nas sessões de provador. Como os atributos específicos de tamanho não estavam presentes na versão pública utilizada, essas repetições foram tratadas apenas como informação de frequência, sem inferir sua causa (Wölbitsch et al., 2020).
Além das três variáveis originais, foram derivadas medidas necessárias às análises. Calculou-se o número de registros por sessão, a presença de cada categoria ou produto, a frequência de repetição e as medidas de associação entre itens. A Tabela 2 apresenta a operacionalização das principais variáveis.
Tabela 2. Variáveis utilizadas e derivadas na pesquisa
	Variável
	Tipo
	Utilização
	TransactionId
	Identificador de sessão
	Agrupamento dos produtos presentes na mesma cesta ou sessão
	ProductId
	Categórica nominal anonimizada
	Identificação do produto no nível mais granular
	ProductType
	Categórica nominal
	Agrupamento dos produtos em oito categorias
	Tamanho da sessão
	Quantitativa discreta
	Número de registros associados a cada TransactionId
	Presença do item
	Binária
	Indicação da ocorrência de produto ou categoria na sessão
	Repetição
	Quantitativa discreta
	Número de ocorrências do mesmo ProductId na sessão
	Item ocultado
	Categórica
	Alvo utilizado na avaliação dos modelos de recomendação
Fonte: Dados originais da pesquisa
Associações entre categorias e produtos
Para identificar itens que ocorreram conjuntamente, aplicou-se a análise de cesta de mercado (market basket analysis), técnica utilizada para extrair relações entre produtos presentes em uma mesma transação. Essa abordagem permite converter registros transacionais em regras de associação e tem sido utilizada em estudos recentes de comportamento e recomendação no varejo (Stylianou e Pantelidou, 2025).
As associações foram estimadas separadamente no nível de ProductType e no nível de ProductId. Para cada regra X→Y, calcularam-se suporte, confiança e lift, conforme eq. (1), eq. (2) e eq. (3). O suporte correspondeu à proporção de sessões em que antecedente e consequente apareceram conjuntamente, enquanto a confiança representou a proporção das ocorrências de X nas quais Y também esteve presente. O lift comparou essa ocorrência conjunta com aquela esperada caso os itens fossem independentes.
 (1)
 (2)
 (3)
em que: n(X∩Y) corresponde ao número de sessões em que X e Y ocorreram conjuntamente; n(X) corresponde ao número de sessões em que X ocorreu; e N corresponde ao número total de sessões analisadas.
A confiança foi utilizada como principal medida relacional para a recomendação, pois representa diretamente a probabilidade condicional de ocorrência do consequente diante do antecedente. O lift foi mantido para avaliar a intensidade da associação descontando a frequência geral do consequente, evitando interpretar apenas produtos populares como relações específicas. A utilização conjunta dessas medidas é recorrente em aplicações de análise de cesta de mercado (Stylianou e Pantelidou, 2025).
Para as associações entre ProductId, restringiram-se as regras aos pares com pelo menos dez ocorrências conjuntas, de modo a reduzir a influência de associações sustentadas por quantidade muito pequena de sessões. Essa precaução foi particularmente relevante para o lift, cuja magnitude pode se elevar quando produtos de baixa frequência aparecem conjuntamente.
Também se compararam as associações observadas no provador com aquelas presentes nas vendas físicas. Para cada um dos 28 pares possíveis entre as oito categorias, calculou-se a diferença entre o lift registrado na experimentação e o lift obtido nas compras físicas. Em seguida, aplicou-se a correlação de postos de Spearman para avaliar o grau de correspondência entre as ordenações das associações nos dois ambientes. Essa comparação foi realizada em nível agregado, sem pressupor que uma sessão de provador correspondesse a uma compra específica.
Avaliação da recomendação
A capacidade de recomendação foi avaliada por meio de uma tarefa de conclusão de sessão, abordagem compatível com sistemas que ordenam itens relevantes a partir das informações disponíveis no contexto corrente (Ricci et al., 2022). Não se realizou previsão da próxima peça, pois a base não apresentou ordem temporal dos produtos dentro do TransactionId.
Em cada sessão elegível com pelo menos dois itens distintos, retirou-se um item para constituir o alvo da avaliação e utilizaram-se os demais como contexto do recomendador. O modelo produziu uma lista ordenada de candidatos e verificou-se a posição em que o item ocultado foi recuperado. A Figura 1 sintetizou esse procedimento.
Figura 1. Protocolo utilizado para avaliação da conclusão das sessões de experimentação
Fonte: Dados originais da pesquisa
As sessões foram separadas entre treinamento e teste sem permitir que uma mesma sessão participasse simultaneamente das duas etapas. Para reduzir a dependência dos resultados de uma única divisão dos dados, estruturou-se a avaliação em cinco partições, utilizando-se em cada rodada aproximadamente 80% das sessões para treinamento e 20% para teste. Os indicadores finais foram calculados pela média das partições, acompanhados da variabilidade observada entre elas.
Quatro estratégias de recomendação foram comparadas. O modelo aleatório serviu como referência mínima; o modelo de popularidade ordenou os candidatos conforme a frequência observada no conjunto de treinamento; o modelo de confiança ordenou os produtos segundo as associações condicionais com os itens presentes no contexto; e o modelo de lift considerou a intensidade relativa dessas associações. A comparação com referências simples permitiu determinar se a informação relacional presente nas sessões acrescentou capacidade de recomendação além da frequência geral dos produtos, procedimento compatível com a avaliação de sistemas de recomendação (Jannach et al., 2022; Ricci et al.,2022).
A avaliação foi realizada em três níveis de detalhamento. No primeiro, utilizaram-se apenas as oito categorias de ProductType. No segundo, empregaram-se os códigos anonimizados de ProductId. No terceiro, mantiveram-se os códigos anônimos e incorporou-se como peso a quantidade de ocorrências do produto no contexto da sessão. Para evitar um resultado trivial, quando determinado ProductId foi selecionado como alvo, todas as suas ocorrências foram retiradas do contexto antes da recomendação.
No nível de categoria, utilizaram-se “Recall”@1 e “Recall”@3, uma vez que o universo continha apenas oito alternativas e posições maiores reduziriam a capacidade discriminatória da métrica. No nível de produto, calcularam-se “Recall”@1, “Recall”@3, “Recall”@5 e “Recall”@10, além de Ganho Cumulativo Descontado Normalizado [NDCG]@10, Posto Recíproco Médio [MRR] e Cobertura [“Coverage”]@10. Essas métricas permitiram avaliar a recuperação do item esperado, sua posição na lista ordenada e a diversidade de produtos alcançada pelos modelos (Ricci et al., 2022).
Construção do framework
Após as análises quantitativas, os resultados foram organizados em um framework composto pelas dimensões de captura, inteligência, aplicação e privacidade. A primeira dimensão representou os dados obtidos a partir do RFID e da sessão; a segunda reuniu as informações derivadas de frequência, associação e recomendação; a terceira relacionou essas saídas a potenciais aplicações no ambiente de varejo; e a quarta classificou o nível mínimo de informação necessário para cada aplicação.
A análise de privacidade concentrou-se na minimização de dados e não na comprovação formal de anonimato ou resistência à reidentificação. Essa distinção foi adotada porque os arquivos analisados não continham nome, CPF, e-mail, endereço, identificador de dispositivo ou vínculo longitudinal com uma pessoa natural. Assim, avaliou-se empiricamente a utilidade obtida sem incorporar identificadores individuais, em consonância com a orientação de limitar o tratamento ao conjunto de informações necessário à finalidade pretendida (Brasil, 2018; Autoridade Nacional de Proteção de Dados [ANPD], 2023).
Por se tratar de dados secundários públicos e previamente anonimizados, não houve recrutamento de participantes, contato com consumidores ou coleta direta de dados pessoais no desenvolvimento das análises. O conjunto também não permitiu reconstruir trajetórias individuais entre provador e compra. O enquadramento institucional quanto ao Formulário de Direcionamento Ético e à eventual necessidade de apreciação ética deve permanecer registrado conforme o resultado formal emitido para o projeto, não sendo o caráter anonimizado da base, isoladamente, utilizado como justificativa automática de dispensa.
Resultados e Discussão
Os resultados foram organizados de acordo com as quatro etapas apresentadas na Metodologia. Inicialmente, caracterizaram-se as bases após o tratamento e comparou-se a estrutura das sessões de provador com as cestas de venda. Em seguida, analisaram-se as associações entre categorias e produtos e verificou-se em que medida essas relações diferiram entre experimentação e compra. Posteriormente, avaliou-se a capacidade dos modelos de completar sessões de experimentação a partir dos produtos já presentes no provador. Por fim, os resultados foram consolidados em um framework que relacionou captura, geração de inteligência, aplicação e minimização de dados pessoais.
Base de dados e tratamento
Após a aplicação do critério de exclusão das sessões com mais de 20 registros, permaneceram 24.443 sessões de provador RFID, 2.076.321 cestas de vendas físicas e 1.112.383 cestas online. A quantidade de observações disponível em cada ambiente permitiu caracterizar separadamente experimentação, compra em loja física e compra no canal digital. A Tabela 3 apresentou os principais indicadores obtidos após o tratamento.
Tabela 3. Perfil das sessões e cestas após o tratamento
	Indicador
	Online
	Venda física
	Provador RFID
	Sessões ou cestas
	1.112.383
	2.076.321
	24.443
	Itens médios por sessão/cesta
	2,24
	2,28
	4,12
	Sessões com ProductId repetido
	17,27%
	6,34%
	24,61%
	Produtos distintos
	14.585
	17.618
	3.789
Fonte: Resultados originais da pesquisa
O número médio de registros por sessão apresentou diferença entre o provador e os dois canais de venda. As sessões de experimentação reuniram, em média, 4,12 registros, enquanto as vendas físicas apresentaram 2,28 e as online 2,24. Portanto, a quantidade de peças registrada durante a experimentação foi aproximadamente 1,8 vez superior àquela observada nas cestas efetivamente comercializadas.
A diferença também apareceu na frequência de repetição dos produtos. Um mesmo ProductId ocorreu mais de uma vez em 24,61% das sessões de provador, enquanto essa situação ocorreu em 17,27% das cestas online e em 6,34% das vendas físicas. Como a base pública não forneceu atributos como tamanho, cor ou variação do item, a repetição foi interpretada apenas como característica da estrutura das sessões e não como evidência de um comportamento específico.
A distribuição do número de itens, apresentada na Figura 2, complementou essa caracterização. As cestas com somente um item concentraram aproximadamente metade das vendas online e físicas. No provador, essa participação ficou próxima de 35%, e as sessões com três ou mais registros passaram a representar parcela proporcionalmente maior do conjunto.
Figura 2. Distribuição do número de itens por sessão ou cesta nos três ambientes
Fonte: Resultados originais da pesquisa
A Figura 2 mostrou que as diferenças não se limitaram à média. No comércio online e nas lojas físicas ocorreu concentração nas cestas de um ou dois itens, seguida de redução rápida das frequências. No provador, a redução ocorreu de maneira menos acentuada, mantendo participação superior para sessões contendo três, quatro, cinco ou mais registros.
Esse comportamento indicou que a experimentação capturada por RFID não reproduziu apenas a composição observada nas vendas. A sessão do provador registrou um conjunto de produtos considerado simultaneamente em uma etapa anterior à conclusão da compra. Wölbitsch et al. (2020) também identificaram diferenças entre os padrões de experimentação e os padrões transacionais, o que justificou tratar os dados do provador como uma fonte distinta de informação.
A composição das categorias forneceu evidência adicional dessa diferença. Tops estiveram presentes em 61,95% das sessões de provador, Pants em 53,54% e Shirts em 35,19%. Footwear, por outro lado, apareceu em apenas 5,27% das sessões de experimentação, embora tenha ocorrido em 44,90% das cestas de vendas físicas.
A diferença entre essas proporções não foi interpretada como conversão ou abandono de produtos, pois os dados não permitiram ligar uma sessão específica a uma compra posterior. A informação obtida indicou apenas que a estrutura de produtos observada durante a experimentação diferiu daquela registrada no ponto de venda. Essa distinção reforçou o papel do RFID como fonte de visibilidade em nível de item, para além do registro da transação final, conforme discutido por Ovezmyradov e Kurata (2022).
Dessa forma, a primeira etapa dos resultados indicou que os dados produzidos no provador acrescentaram uma camada de informação que não estava contida nas vendas. A análise seguinte investigou se essa diferença também se manifestou nas relações entre os produtos presentes nas sessões.
Associações entre categorias e produtos
As relações entre os itens foram inicialmente examinadas no nível das oito categorias de produto. Para isso, calcularam-se suporte, confiança e lift para os pares presentes nas sessões de provador. A Tabela 4 apresentou associações selecionadas com base na combinação entre frequência de ocorrência e intensidade da relação.
Tabela 4. Associações selecionadas entre categorias nas sessões de provador RFID
	Categoria A
	Categoria B
	Suporte
	Confiança A→B
	Confiança B→A
	Lift
	Pants
	Shirts
	23,98%
	44,80%
	68,15%1,27
	Pants
	Others
	6,80%
	12,71%
	70,86%
	1,32
	Pants
	Underwear
	6,25%
	11,67%
	69,98%
	1,31
	Shirts
	Underwear
	5,49%
	15,60%
	61,50%
	1,75
	Shirts
	Others
	5,49%
	15,59%
	57,14%
	1,62
	Footwear
	Socks
	0,19%
	3,57%
	14,07%
	2,67
Fonte: Resultados originais da pesquisa
A combinação entre Pants e Shirts apresentou suporte de 23,98%, sendo uma das associações com maior presença nas sessões analisadas. Quando Pants esteve presente, Shirts apareceu em 44,80% das sessões; no sentido inverso, Pants ocorreu em 68,15% das sessões que continham Shirts. O lift de 1,27 indicou que essa ocorrência conjunta foi 27% superior ao que seria esperado caso as duas categorias fossem independentes.
As relações envolvendo Underwear apresentaram menor suporte, mas lifts superiores. Shirts e Underwear ocorreram conjuntamente em 5,49% das sessões e apresentaram lift de 1,75. Isso significou que a presença conjunta dessas categorias ocorreu aproximadamente 75% acima daquela esperada pelas frequências individuais.
A relação entre Footwear e Socks apresentou o maior lift entre as combinações selecionadas, de 2,67. Entretanto, seu suporte foi de apenas 0,19%. Esse resultado demonstrou a necessidade de interpretar o lift juntamente com frequência e suporte, pois uma associação relativamente intensa pode representar uma parcela pequena das sessões observadas.
A assimetria das medidas de confiança também apresentou informação relevante. Enquanto 12,71% das sessões contendo Pants também continham Others, 70,86% das sessões contendo Others incluíam Pants. Isso ocorreu porque a confiança depende da frequência da categoria utilizada como antecedente e, portanto, possui interpretação direcional.
Essa característica fundamentou a decisão de utilizar confiança e lift para funções distintas no estudo. O lift permitiu avaliar se determinada associação ocorreu acima da expectativa derivada das frequências individuais, enquanto a confiança expressou a probabilidade condicional de ocorrência de um item diante da presença de outro. Para recomendação, essa interpretação condicional foi mais diretamente relacionada ao problema de ordenar candidatos a partir do conteúdo da sessão, conforme os princípios descritos por Ricci et al. (2022).
As associações também foram calculadas no nível de ProductId. Nessa etapa, produtos anonimizados que apareceram conjuntamente em pelo menos dez sessões foram mantidos na análise. Como não havia descrição comercial dos produtos, esses resultados foram utilizados principalmente para estruturar os modelos de recomendação, evitando atribuir significado mercadológico a códigos cujo conteúdo específico não estava disponível.
Além de identificar associações internas ao provador, investigou-se se a estrutura dessas relações se repetiu nas compras físicas. Para isso, compararam-se os lifts dos 28 pares possíveis entre as oito categorias. A Figura 3 apresentou os valores obtidos nos dois ambientes.
Figura 3. Relação entre os lifts das categorias no provador RFID e nas vendas físicas
Fonte: Resultados originais da pesquisa
Caso experimentação e compra apresentassem estruturas de associação equivalentes, os pontos tenderiam a se concentrar ao redor da linha diagonal. Entretanto, foram observados afastamentos em diferentes combinações. A correlação de postos de Spearman foi de ρ = 0,322, com p = 0,094.
O coeficiente indicou associação positiva entre as ordenações dos lifts, porém de magnitude limitada. Além disso, o valor de p não atingiu 0,05, razão pela qual o resultado foi tratado como exploratório. Não se rejeitou, portanto, a possibilidade de ausência de associação entre os rankings dos dois ambientes.
Alguns pares ilustraram essa divergência. Footwear e Socks apresentaram lift de 2,67 no provador e valor próximo de 1,00 nas compras físicas. Nesse caso, a associação relativa ocorreu durante a experimentação, mas praticamente desapareceu quando observadas as cestas de venda. Em sentido contrário, Pants e Tops apresentaram lift de 0,90 no provador e 1,38 nas vendas.
Essas diferenças indicaram que os padrões de associação observados durante a experimentação não puderam ser substituídos diretamente pelas relações encontradas nas vendas. O resultado esteve de acordo com a proposta de Wölbitsch et al. (2020), que tratou os diferentes canais como fontes capazes de registrar padrões distintos de interação com produtos.
A interpretação permaneceu limitada pelas características da base. Os dados de provador e de vendas foram obtidos em períodos e regiões diferentes e não permitiram acompanhar o mesmo consumidor. Assim, a divergência encontrada não demonstrou mudança entre experimentação e compra de uma mesma pessoa, mas mostrou que os dois conjuntos apresentaram estruturas agregadas de associação que não foram equivalentes.
Essa constatação justificou a utilização dos próprios dados de provador na etapa seguinte. Em vez de tentar transferir relações de compra para o ambiente de experimentação, avaliou-se se as relações existentes dentro das sessões RFID continham informação suficiente para recomendar um produto pertencente àquela própria sessão.
Avaliação da recomendação
A avaliação da recomendação foi conduzida como uma tarefa de conclusão de sessão. Um produto pertencente à sessão foi ocultado e os demais itens foram utilizados para gerar uma lista ordenada de sugestões. O resultado foi considerado adequado quando o item retirado apareceu entre as primeiras posições do ranking.
A primeira análise ocorreu no nível de ProductType. Como o universo continha somente oito categorias, o Recall@1 forneceu a medida com maior capacidade de diferenciação entre os modelos. A Tabela 5 apresentou o desempenho obtido por popularidade, lift e confiança.
Tabela 5. Recall@1 dos modelos no nível de categoria
	Modelo
	Recall@1
	Popularidade
	62,9%
	Lift
	7,1%
	Confiança
	65,8%
Fonte: Resultados originais da pesquisa
O modelo de popularidade recuperou a categoria omitida na primeira posição em 62,9% das avaliações. Esse resultado decorreu da concentração das sessões em algumas categorias, principalmente Tops, Pants e Shirts. Assim, mesmo sem considerar os outros itens presentes na sessão, a frequência geral forneceu uma referência com capacidade de acerto.
Quando as relações condicionais entre as categorias foram incorporadas, o Recall@1 aumentou para 65,8%. O acréscimo de 2,9 pontos percentuais indicou que o contexto da sessão forneceu informação adicional à frequência geral, embora o ganho tenha permanecido limitado no nível de categoria.
O resultado esteve relacionado à baixa granularidade dessa representação. Com apenas oito possíveis categorias, grande parte das sessões foi composta por classes recorrentes, o que favoreceu o modelo de popularidade. O espaço reduzido de candidatos também limitou a diferença potencial entre modelos de recomendação.
O lift apresentou comportamento distinto, com Recall@1 de 7,1%. Esse valor não indicou que o lift tenha falhado na identificação de associações. Como a medida elevou a posição de combinações cuja coocorrência foi proporcionalmente superior ao esperado, itens menos frequentes puderam receber posições elevadas no ranking, reduzindo a recuperação direta do alvo mais provável.
A diferença entre confiança e lift reforçou a necessidade de separar descoberta de associação de recomendação. Para análise das relações entre produtos, o lift forneceu informação sobre intensidade relativa. Para ordenar o produto mais provável diante do contexto observado, a confiança apresentou maior aderência ao objetivo. Essa distinção é compatível com a necessidade de selecionar funções de ordenação de acordo com a finalidade do sistema de recomendação, conforme Ricci et al. (2022).
Em seguida, a análise foi repetida no nível de ProductId. Nesse cenário, as categorias amplas foram substituídas pelos códigos individuais e anonimizados dos produtos. O número de candidatos aumentou de oito categorias para milhares de produtos, tornando a tarefa de conclusão da sessão mais discriminante.
A Tabela 6 apresentouo Recall@10 dos três modelos. Essa métrica indicou a proporção de vezes em que o produto ocultado foi recuperado entre as dez primeiras recomendações.
Tabela 6. Recall@10 dos modelos no nível de produto anônimo
	Modelo
	Recall@10
	Diferença em relação à popularidade
	Popularidade
	9,3%
	—
	Lift
	27,0%
	+17,7 p.p.
	Confiança
	48,6%
	+39,3 p.p.
Fonte: Resultados originais da pesquisa
A recomendação baseada exclusivamente em popularidade recuperou o produto ocultado entre as dez primeiras posições em 9,3% das avaliações. Quando o ranking utilizou as relações de lift entre os produtos, o Recall@10 aumentou para 27,0%. Portanto, a informação sobre coocorrência elevou a recuperação em 17,7 pontos percentuais em relação ao baseline de frequência.
O modelo baseado em confiança alcançou Recall@10 de 48,6%, diferença de 39,3 pontos percentuais em relação à popularidade. Em termos relativos, o resultado correspondeu a aproximadamente 5,2 vezes o desempenho do baseline de popularidade. A Figura 4 permite visualizar essa diferença entre os modelos.
Figura 4. Recall@10 dos modelos de recomendação no nível de produto anônimo
Fonte: Resultados originais da pesquisa
O aumento observado entre popularidade, lift e confiança mostrou que a informação contida na composição da sessão permitiu restringir o conjunto de candidatos de maneira relacionada ao produto ocultado. O modelo não recebeu qualquer variável que descrevesse o consumidor, utilizando apenas os produtos presentes naquela interação.
Esse resultado constituiu a principal evidência quantitativa do estudo. A capacidade de recuperar o produto em 48,6% das avaliações não decorreu de um perfil histórico, de características demográficas ou da identificação do indivíduo. O sinal utilizado pelo modelo correspondeu exclusivamente à associação entre itens que apareceram conjuntamente nas sessões registradas pelo RFID.
A comparação entre categoria e produto também mostrou que o aumento da granularidade sobre o produto alterou o tipo de inteligência gerada. No nível de categoria, a frequência geral explicou parcela elevada do resultado e a confiança acrescentou somente 2,9 pontos percentuais ao Recall@1. No nível de produto anônimo, as relações entre itens produziram diferença maior em relação à popularidade.
Isso indicou que acrescentar detalhe ao objeto identificado pelo RFID apresentou utilidade analítica sem exigir aumento equivalente da informação sobre o consumidor. Em outras palavras, o modelo recebeu identificação mais específica do produto, mas permaneceu sem nome, CPF, e-mail, histórico individual ou qualquer outro identificador pessoal.
A análise das repetições acrescentou uma terceira comparação. Quando a quantidade de ocorrências de cada ProductId dentro da sessão foi incorporada como peso, não ocorreu aumento consistente das métricas de recomendação. Portanto, a existência do produto na sessão forneceu o principal sinal relacional, enquanto sua repetição não acrescentou informação preditiva relevante no desenho utilizado.
Esse resultado impediu a conclusão de que maior volume de dados, por si só, tenha produzido melhor recomendação. A informação adicional precisa contribuir para distinguir o alvo; caso contrário, sua coleta ou utilização acrescenta complexidade sem ganho correspondente. Esse aspecto é compatível com a discussão de minimização de dados, na qual a necessidade de cada informação deve estar vinculada à finalidade definida.
Os resultados também dialogaram com a literatura de sistemas de recomendação. Jannach et al. (2022) apontaram que a efetividade de um recomendador depende das informações disponíveis, da escolha do método e da forma de avaliação. Ricci et al. (2022) discutiram, de modo semelhante, a importância do contexto e das interações entre itens para a construção de rankings relevantes.
Apesar do desempenho obtido, o experimento permaneceu uma avaliação offline. O Recall@10 de 48,6% significou apenas que o produto retirado artificialmente da sessão apareceu entre as dez primeiras posições em aproximadamente metade das avaliações. O indicador não representou probabilidade de compra, aceitação de recomendação, aumento de ticket ou crescimento de vendas.
Essa distinção delimitou a aplicação possível dos resultados. A análise demonstrou a presença de sinal informacional nas sessões de provador, mas uma eventual consequência comercial dependeria de teste em ambiente real. Como discutido por Jannach et al. (2022), métricas offline de recomendação não substituem experimentos destinados a medir comportamento, satisfação ou impacto econômico.
Construção do framework
Os resultados anteriores permitiram organizar os diferentes níveis de inteligência de acordo com os dados exigidos para sua produção. A Tabela 7 apresentou as aplicações analisadas e distinguiu aquelas que puderam ser obtidas sem identificação pessoal das aplicações que dependeriam de um vínculo persistente com o consumidor.
Tabela 7. Inteligência produzida e dados necessários para sua obtenção
	Aplicação
	Dado mínimo
	Identificação pessoal
	Situação no estudo
	Frequência de experimentação
	Sessão + categoria ou produto
	Não
	Avaliada
	Associação entre categorias
	Sessão + ProductType
	Não
	Avaliada
	Associação entre produtos
	Sessão + ProductId
	Não
	Avaliada
	Recomendação contextual
	Produtos presentes na sessão
	Não
	Avaliada
	Perfil entre diferentes visitas
	Identificador persistente
	Sim
	Não avaliada
	Remarketing individual
	Identificador e contato
	Sim
	Não avaliada
Fonte: Resultados originais da pesquisa
As quatro primeiras aplicações utilizaram somente dados relacionados ao produto e à sessão corrente. A frequência de experimentação exigiu saber quais itens estiveram presentes; as associações dependeram do agrupamento dos produtos em uma mesma sessão; e a recomendação acrescentou o uso dessas relações para ordenar itens candidatos.
Nenhuma dessas análises exigiu identificar a pessoa que utilizou o provador. O TransactionId funcionou como identificador técnico de uma sessão e deixou de ter utilidade para o modelo após o agrupamento dos produtos. Ele não permitiu conectar diferentes visitas nem formar um histórico individual.
Em contrapartida, aplicações como criação de perfil longitudinal ou remarketing exigiriam algum identificador capaz de reconhecer o mesmo consumidor em momentos distintos. Essas aplicações não foram testadas e permaneceram fora do escopo do estudo.
A principal diferença entre esses dois grupos esteve no objetivo do processamento. Para recomendar um produto durante uma sessão em andamento, o contexto momentâneo foi suficiente. Para lembrar o comportamento de uma pessoa após o encerramento dessa sessão, seria necessária outra camada de identificação e armazenamento. A Figura 5 sintetizou essa organização e separou as etapas sustentadas diretamente pelas análises daquelas cuja interpretação permaneceu conceitual.
Figura 5. Framework de geração de inteligência a partir de dados RFID orientado à minimização de dados pessoais
Fonte: Resultados originais da pesquisa
Na camada de captura, os registros de RFID forneceram os identificadores de produtos e o agrupamento da sessão. Na camada de inteligência, esses dados foram transformados em frequências, associações e rankings de recomendação. Ambas as etapas foram avaliadas diretamente por meio dos dados analisados.
A camada de aplicação foi sustentada pelo experimento offline de conclusão da sessão. O desempenho do modelo de confiança indicou que as informações disponíveis poderiam ser utilizadas para construir recomendações contextuais dentro do ambiente de experimentação. Entretanto, nenhuma interface física ou digital foi implementada junto a consumidores, motivo pelo qual essa camada não foi validada em condições reais de uso.
A dimensão de privacidade apresentou outro limite. O estudo demonstrou que determinadas análises puderam ser executadas sem identificação individual, mas não realizou teste formal de anonimização, ataque de reidentificação ou mensuração de risco de inferência. Portanto,o resultado correspondeu à demonstração de utilidade sob minimização de dados, e não à comprovação de privacidade absoluta.
Essa interpretação esteve relacionada ao princípio da necessidade previsto na proteção de dados pessoais. A Autoridade Nacional de Proteção de Dados [ANPD] (2024) destacou a importância de limitar o tratamento às informações pertinentes à finalidade estabelecida. No presente estudo, a recomendação contextual foi produzida sem a incorporação de variáveis que identificassem o consumidor.
O resultado também apresentou implicação para o desenho de aplicações digitais no varejo. Em vez de condicionar toda personalização ao acúmulo de histórico individual, parte da inteligência pôde ser produzida a partir do contexto momentâneo da interação. Chang et al. (2024) discutiram que a utilização de tecnologias inteligentes no varejo envolve não apenas capacidade tecnológica, mas também decisões sobre integração, governança e interação com o consumidor.
As limitações da base permaneceram relevantes para a interpretação do framework. O conjunto correspondeu a um único varejista e não forneceu atributos detalhados dos produtos, como preço, cor ou tamanho. Também não apresentou ordem temporal dos registros dentro das sessões, o que impossibilitou analisar a sequência de experimentação.
Adicionalmente, não existiu vínculo entre uma sessão de provador e uma compra individual, e os dados de experimentação e vendas foram coletados em períodos e regiões distintos. Dessa forma, não foi possível medir conversão, abandono de peças ou efeito da experimentação sobre a venda.
Mesmo diante dessas limitações, os resultados responderam ao problema proposto dentro do escopo permitido pelos dados. As sessões RFID forneceram informação suficiente para identificar relações entre produtos e sustentar uma tarefa de recomendação contextual. O desempenho obtido no nível de produto mostrou que essa utilidade foi alcançada sem incorporar identificação individual do consumidor.
Em síntese, o estudo não demonstrou que o uso do recomendador aumentaria vendas, mas demonstrou que a sessão anônima continha informação utilizável para recomendar produtos. A diferença entre o Recall@10 de 9,3% da popularidade e de 48,6% da confiança mostrou que conhecer a relação entre os itens presentes na sessão produziu informação adicional à frequência geral dos produtos. Esse resultado forneceu a base empírica para o framework proposto e delimitou quais formas de inteligência puderam ser obtidas sem ampliar a coleta de informações sobre a pessoa.
Considerações Finais
A difusão do RFID no varejo de moda ampliou o volume de registros gerados antes da compra, especialmente em provadores instrumentados. Este estudo avaliou em que medida esses registros permitiram gerar recomendações de produtos sem identificação individual do consumidor, considerando diferentes níveis de detalhamento dos dados, e propôs um framework de uso orientado à minimização de dados pessoais.
As sessões de experimentação apresentaram estrutura distinta das cestas de venda, tanto no número de itens quanto na composição das categorias. As associações entre categorias observadas no provador não corresponderam às registradas nas compras físicas, o que indicou que os dois ambientes captaram padrões próprios de interação com os produtos. Entre os modelos comparados, a ordenação por confiança superou de forma expressiva a referência de popularidade no nível de produto anônimo, enquanto o peso atribuído à repetição de itens não acrescentou capacidade preditiva.
Esses achados responderam ao objetivo proposto. A sessão anônima conteve informação suficiente para sustentar recomendação contextual, sem perfil histórico, atributo demográfico ou identificador pessoal. Na prática, o ganho analítico decorreu de maior detalhamento do produto, e não da pessoa, o que permitiu ampliar a inteligência gerada no provador sem ampliar a coleta de dados pessoais. O framework consolidou essa distinção ao separar as aplicações viáveis apenas com dados de sessão daquelas que dependeriam de identificador persistente, oferecendo critério objetivo para decidir entre utilidade analítica e exposição informacional.
O estudo apresentou limitações. Os dados provieram de um único varejista, sem atributos descritivos dos produtos, sem ordem temporal dentro da sessão e sem vínculo entre experimentação e compra, o que impediu mensurar conversão. A avaliação foi conduzida de forma offline, de modo que o desempenho alcançado não expressou aceitação da recomendação nem efeito comercial. A dimensão de privacidade restringiu-se à minimização de dados, sem teste formal de anonimização ou de resistência à reidentificação. Pesquisas futuras poderão validar o framework em operação real, com múltiplos varejistas e registro temporal das sessões.
Referências
Autoridade Nacional de Proteção de Dados [ANPD]. 2023. Guia orientativo: tratamento de dados pessoais para fins acadêmicos e para a realização de estudos e pesquisas. Disponível em: https://www.gov.br/anpd/pt-br/centrais-de-conteudo/materiais-educativos-e-publicacoes/guia-orientativo-tratamento-de-dados-pessoais-para-fins-academicos-e-para-a-realizacao-de-estudos-e-pesquisas. Acesso em: 21 set. 2026.
Brasil. 2018. Lei nº 13.709, de 14 de agosto de 2018. Lei Geral de Proteção de Dados Pessoais [LGPD]. Diário Oficial da União, Brasília, 15 ago. 2018. Seção 1: 59. 
Cai H, Mardani A. 2023. Research on the impact of consumer privacy and intelligent personalization technology on purchase resistance. Journal of Business Research 161: 113811. 
Chang HJ, Bruess F, Chong JW. 2024. Opportunities and challenges of smart technology for small independent fashion retailers: a reflexive thematic analysis using the technology-organization-environment framework. Fashion and Textiles 11: 26. 
Eichinger T, Küpper A. 2024. On data minimization and anonymity in pervasive mobile-to-mobile recommender systems. Pervasive and Mobile Computing 103: 101951. 
Gil AC. 2019. Métodos e técnicas de pesquisa social. 7ed. Atlas, São Paulo, SP, Brasil. 
Jannach D, Pu P, Ricci F, Zanker M. 2022. Recommender systems: trends and frontiers. AI Magazine 43(2): 145-150. 
Kotler P, Kartajaya H, Setiawan I. 2021. Marketing 5.0: Technology for Humanity. 1ed. John Wiley & Sons, Hoboken, NJ, Estados Unidos. 
McKinsey & Company; The Business of Fashion. 2024. The State of Fashion 2025: Challenges at Every Turn. Disponível em: https://www.mckinsey.com/industries/retail/our-insights/state-of-fashion-2025. Acesso em: 21 set. 2026. 
Ovezmyradov B, Kurata H. 2022. Omnichannel fulfillment and item-level RFID tracking in fashion retailing. Computers & Industrial Engineering 168: 108108. 
Ricci F, Rokach L, Shapira B, eds. 2022. Recommender Systems Handbook. 3ed. Springer, New York, NY, Estados Unidos. 
Stylianou T, Pantelidou A. 2025. A machine learning approach to consumer behavior in supermarket analytics. Decision Analytics Journal 16: 100600. 
Wölbitsch M, Hasler T, Walk S, Helic D. 2020. Mind the Gap: Exploring Shopping Preferences Across Fashion Retail Channels. In: UMAP 2020 - Proceedings of the 28th ACM Conference on User Modeling, Adaptation and Personalization. Association for Computing Machinery, New York, NY, Estados Unidos. p. 257-265.
Online	1	2	3	4	5	6	7	8	9	10	11	12	13	14	15	16	17	18	19	20	0.52587373233859203	0.25282479146121428	7.7671089903387586E-2	3.9486399918013851E-2	3.1535900854292087E-2	2.1614857472651051E-2	1.077057092745934E-2	7.6070921616026134E-3	5.8208368880142899E-3	1.015837171190139E-2	2.8128800961539331E-3	3.3936153285334279E-3	1.3062047873798859E-3	1.904919438718499E-3	1.5201598729933841E-3	1.5642094494432	22E-3	1.0446042415247271E-3	9.4391949535366866E-4	8.8189049994471331E-4	1.26395315282596E-3	Venda física	1	2	3	4	5	6	7	8	9	10	11	12	13	14	15	16	17	18	19	20	0.49332063780118779	0.23057176611901531	0.11024017962540469	6.1500606120151943E-2	3.564381422718356E-2	2.2345292466819919E-2	1.401999016529718E-2	9.4046151823345241E-3	6.4575756831434057E-3	4.5927387913525892E-3	3.2013354389807741E-32.3584985173294489E-3	1.674114936948574E-3	1.295560753852608E-3	1.00321674731412E-3	7.0846463528519913E-4	5.5049291511283661E-4	4.3827519925868877E-4	3.4676719062225929	E-4	3.2605748340454099E-4	Provador RFID	1	2	3	4	5	6	7	8	9	10	11	12	13	14	15	16	17	18	19	20	0.35388454772327449	0.19117947878738289	0.1159432148263306	7.7445485415047255E-2	4.8030110870187777E-2	3.0192693204598449E-2	2.3524117334206111E-2	1.7387391073108861E-2	1.6323691854518679E-2	1.4155381908930981E-2	1.227345252219449E-2	1.2355275539009119E-2	1.129157632041893E-2	1.2232541013787179E-2	1.080063821953115E-2	1.0882461236345779E-2	1.01051425766068E-2	1.0514257660679951E-2	1.1537045370862821E-2	9.941496542977539E-3	Número de itens na sessão ou cesta
Participação das sessões/cestas (%)
Pares de categorias	0.99916230869687372	2.4053853809131369	1.3092331480183821	0.89769579907719921	1.1049480477631879	1.1815970842367061	1.170756720245087	1.321453990660977	1.0236003632400821	1.384709848696827	1.1118037058474619	0.89265357652460975	0.54629564208523496	0.51994207790617974	0.96739313861825893	1.6478702407822929	1.632551751573091	1.48198086289497	1.142813196631582	1.4405807492891369	0.64677200571624949	0.72517523661659822	0.87316788367139886	1.075355826145483	1.0830304915946389	0.61065566209039268	0.6848602	6024258817	1.2641198107021929	2.669615552643076	1.670531680945349	0.5816730606949615	1.623569027604979	0.41318021118844328	1.815384074145014	0.6705200387962259	0.82926522120647206	0.53382649336386723	0.89785744641216469	0.65651775196743134	1.323508550592615	0.95306594884044016	0.92378554246489775	0.58520908535955751	1.3071694296757559	1.9188835244202269	1.747643472165896	0.93730004907259157	1.2675168251779221	0.80015058268953776	0.86361948005827061	1.009614435268309	1.1904958451451799	0.98249033329734459	0.67924430983628947	0.63878196561223921	1.272899065623607	Linha de igualdade	0	2.8	0	2.8	Lift na venda física
Lift no provador RFID
Recall@10	
Confiança	Lift	Popularidade	0.48599999999999999	0.27	9.2999999999999999E-2	
Recall@10 (%)
4
image1.png
image2.png
image3.png

Mais conteúdos dessa disciplina