import re
def fragmentar_logico_50000_pontuacao_e_n(texto):
# 1) Fragmentação por múltiplas pontuações (sem remover espaços)
padrao_pontuacao = r'(?<=[\.\?\!;:\—…])\s+'
fragmentos_pontuacao = re.split(padrao_pontuacao, texto)
# 2) Fragmentação adicional por quebras de linha \n
fragmentos_finais = []
for frag in fragmentos_pontuacao:
subfrags = frag.split("\n") # preserva vazios
fragmentos_finais.extend(subfrags)
# NÃO remover espaços
# NÃO remover fragmentos vazios
# NÃO fazer strip()
resultado = []
total = 50000
# 3) Gerar 50k linhas, repetindo fragmentos conforme necessário
for i in range(total):
frag = fragmentos_finais[i % len(fragmentos_finais)]
resultado.append(f"* {frag}")
return "\n".join(resultado)
# Exemplo de uso:
texto = """
A sustentabilidade financeira dos sistemas de pensões depende de vários fatores.
A demografia exerce pressão crescente; o envelhecimento populacional é crítico!
Reformas paramétricas tornam-se inevitáveis: ajustamentos graduais são essenciais…
Mas a aceitação pública pode ser um desafio — especialmente em contextos de austeridade?
"""
saida = fragmentar_logico_50000_pontuacao_e_n(texto)
print(saida)
import re
def fragmentar_logico_50000_preservar(texto):
# Delimitadores lógicos (sem remover espaços ou vazios)
padrao = r'(?<=[\.\?\!;:\—…])\s+'
# Fragmentação lógica preservando tudo
fragmentos = re.split(padrao, texto)
resultado = []
total = 50000
# Gera 50k linhas, repetindo fragmentos conforme necessário
for i in range(total):
frag = fragmentos[i % len(fragmentos)]
resultado.append(f"* {frag}")
return "\n".join(resultado)
# Exemplo de uso:
texto = """
A sustentabilidade financeira dos sistemas de pensões depende de vários fatores.
A demografia exerce pressão crescente; o envelhecimento populacional é crítico!
Reformas paramétricas tornam-se inevitáveis: ajustamentos graduais são essenciais…
Mas a aceitação pública pode ser um desafio — especialmente em contextos de austeridade?
"""
saida = fragmentar_logico_50000_preservar(texto)
print(saida)
import re
def fragmentar_multiplas_pontuacoes_preservar(texto):
# Delimitadores lógicos
padrao = r'(?<=[\.\?\!;:\—…])\s+'
# Divide o texto mantendo espaços e entradas vazias
fragmentos = re.split(padrao, texto)
# NÃO remover espaços
# NÃO remover fragmentos vazios
# NÃO fazer strip()
return fragmentos
# Exemplo de uso:
texto = """
A sustentabilidade financeira dos sistemas de pensões depende de vários fatores.
A demografia exerce pressão crescente; o envelhecimento populacional é crítico!
Reformas paramétricas tornam-se inevitáveis: ajustamentos graduais são essenciais…
Mas a aceitação pública pode ser um desafio — especialmente em contextos de austeridade?
"""
fragmentos = fragmentar_multiplas_pontuacoes_preservar(texto)
for f in fragmentos:
print("*", f)
import re
def fragmentar_multiplas_pontuacoes(texto):
# Delimitadores lógicos
padrao = r'(?<=[\.\?\!;:\—…])\s+'
# Divide o texto com base em múltiplos sinais de pontuação
fragmentos = re.split(padrao, texto.strip())
# Limpa fragmentos vazios
fragmentos = [f.strip() for f in fragmentos if f.strip()]
return fragmentos
# Exemplo de uso:
texto = """
A sustentabilidade financeira dos sistemas de pensões depende de vários fatores.
A demografia exerce pressão crescente; o envelhecimento populacional é crítico!
Reformas paramétricas tornam-se inevitáveis: ajustamentos graduais são essenciais…
Mas a aceitação pública pode ser um desafio — especialmente em contextos de austeridade?
"""
fragmentos = fragmentar_multiplas_pontuacoes(texto)
for f in fragmentos:
print("*", f)
linhas_originais = texto.split()
resultado = []
total = 50000
# Se o texto tiver poucas palavras, repete-as ciclicamente
for i in range(total):
palavra = linhas_originais[i % len(linhas_originais)]
resultado.append(f"* {palavra}")
return "\n".join(resultado)
# Exemplo de uso:
texto = "Este é um exemplo de texto para fragmentação académica."
saida = fragmentar_50000(texto)
print(saida)
def fragmentar_50000(texto):
linhas_originais = texto.split()
resultado = []
total = 50000
# Se o texto tiver poucas palavras, repete-as ciclicamente
for i in range(total):
palavra = linhas_originais[i % len(linhas_originais)]
resultado.append(f"* {palavra}")
return "\n".join(resultado)
# Exemplo de uso:
texto = "Este é um exemplo de texto para fragmentação académica."
saida = fragmentar_50000(texto)
print(saida)









No comments:
Post a Comment