▲ 4 r/Vllm

Best configuration

How do find the best configuration for serving? Which tools do you use? Whats your methodology?

I am using vllm bench for running experiments varying configuration (e.g. pp=8, pp=4). I wonder if this is cost effective.

reddit.com
u/Senior_Tea_842 — 2 days ago
▲ 0 r/agile

Gerenciamento de Contratada

Sou concursado como dev. Porém, atualmente, minha função é gerenciar a equipe da empresa contratada para desenvolver os softwares utilizando scrum.

Entendo que meu papel no gerenciamento seja aquele de um Product Owner. Porém, quase todo dia tenho de ficar discutindo detalhes técnicos de implantação e de arquitetura, framework, melhoria de código, etc. Isso toma muito tempo além das dailies, planing e refinamento de backlog.

Vou dar um exemplo: quando contrato uma empresa pra construir minha casa usando scrum, não espero ficar discutindo com o mestre de obra sobre o projeto elétrico, encanamento, etc.

Minha visão está errada? Seria um problema de falta de senioridade na equipe de devs? Costuma acontecer assim com vocês? Como eu poderia levar isso pra meu gerente?

Quando atuava no mercado, na minha experiência, não era assim que funcionava.

reddit.com
u/Senior_Tea_842 — 5 days ago
▲ 2 r/brdev

Gerenciamento de Contratada

Sou concursado como dev. Porém, atualmente, minha função é gerenciar a equipe da empresa contratada para desenvolver os softwares utilizando scrum.

Entendo que meu papel no gerenciamento seja aquele de um Product Owner. Porém, quase todo dia tenho de ficar discutindo detalhes técnicos de implantação e de arquitetura, framework, melhoria de código, etc. Isso toma muito tempo além das dailies, planing e refinamento de backlog.

Vou dar um exemplo: quando contrato uma empresa pra construir minha casa usando scrum, não espero ficar discutindo com o mestre de obra sobre o projeto elétrico, encanamento, etc.

Minha visão está errada? Seria um problema de falta de senioridade na equipe de devs? Costuma acontecer assim com vocês? Como eu poderia levar isso pra meu gerente?

Quando atuava no mercado, na minha experiência, não era assim que funcionava.

reddit.com
u/Senior_Tea_842 — 5 days ago
▲ 2 r/mlops

NUMA Affinity

Do you think it is important to configure numactl --membind to get a better performance?

I ran a toy example where GPU has NUMA Affinity with 0. I got an ~9% improvement.

$ numactl --show
policy: default
preferred node: current
physcpubind: 8 9 10 11 136 137 138 139 
cpubind: 0 
nodebind: 0 
membind: 0 1 2 3 4 5 6 7 
preferred:

$ time numactl --membind=0 python memory.py 
time:  159.3454790781252 

real    2m41.164s
user    2m25.306s
sys     0m16.084s

$ time numactl --membind=7 python memory.py 
time:  174.3593455599621

real    2m56.384s
user    2m32.279s
sys     0m24.293s

reddit.com
u/Senior_Tea_842 — 20 days ago

Medo constante de voltar à pobreza

Cresci numa favela onde vi de tudo (parte dos colegas da rua onde cresci morreu no tráfico). Éramos pobres, mas nunca passei fome. Por meio dos estudos e da sorte, me tornei servidor público perto dos 30 anos. Vivendo sempre num padrão de vida muito abaixo da minha renda mensal, em 10 anos acumulei um certo patrimônio em investimentos (moro de aluguel até hoje, meu único patrimônio físico é um carro popular).

Pensei que, ao alcançar aquela marca de patrimônio, poderia ter alguma paz. Porém, ainda vivo com medo constante de voltar à pobreza. Já discuti isso muito em terapia, mas, como não tive melhora, resolvi postar aqui.

Eu vejo os preços dos imóveis, aluguéis, planos de saúde, mensalidade escolar, inflação... Tudo isso só me faz sentir vulnerável, com receio de voltar à pobreza.

  1. Quem compartilha da mesma dor ou trajetória, como você lida com isso?
  2. Até que ponto os investimentos conseguem lhe trazer alguma paz?

Desculpem-me se eu estiver ferindo alguma regra. Não encontrei outra comunidade mais adequada para postar.

reddit.com
u/Senior_Tea_842 — 25 days ago
▲ 6 r/mlops

Onnx vs torch.export - Performance Gap

I exported a fine-tuned U-Net model using both ONNX Runtime and torch.export with a fixed input shape of (64, 3, 512, 512).

Here are the benchmark results for average inference time:

  • ONNX Runtime: ~133.33 s
  • torch.export: ~0.81 s

I expected ONNX Runtime to perform on par with or faster than PyTorch export.

What could be causing this ~160x slowdown?

    onnx_inputs = [torch.randn(64, 3, IMG_SIZE, IMG_SIZE).numpy(force=True)]    
    
    ort_session = onnxruntime.InferenceSession(
        "./model.onnx", providers=["CUDAExecutionProvider"]
    )
    
    onnxruntime_input = {input_arg.name: input_value for input_arg, input_value in zip(ort_session.get_inputs(), onnx_inputs)}
    
    # warm-up    
    onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
    t0 = time.perf_counter()
    onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
    t1 = time.perf_counter()
reddit.com
u/Senior_Tea_842 — 27 days ago

Onnx vs torch.export - Unet

I exported a fine-tuned U-Net model using both ONNX Runtime and torch.export with a fixed input shape of (64, 3, 512, 512).

Here are the benchmark results for average inference time:

  • ONNX Runtime: ~133.33 s
  • torch.export: ~0.81 s

I expected ONNX Runtime to perform on par with or faster than PyTorch export.

What could be causing this ~160x slowdown?

    onnx_inputs = [torch.randn(64, 3, IMG_SIZE, IMG_SIZE).numpy(force=True)]    
    
    ort_session = onnxruntime.InferenceSession(
        "./model.onnx", providers=["CUDAExecutionProvider"]
    )
    
    onnxruntime_input = {input_arg.name: input_value for input_arg, input_value in zip(ort_session.get_inputs(), onnx_inputs)}
    
    # warm-up step
    onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]

    # measuring latency
    t0 = time.perf_counter()
    onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
    t1 = time.perf_counter()
reddit.com
u/Senior_Tea_842 — 27 days ago
▲ 4 r/Vllm

TPOT vs Tensor Parallel Size

I running some experiments to find the best deployment configuration using VLLM and Qwen3.6 27b.

As the parameter --max-concurrency in vllm bench gets larger:

  • For --tensor-parallel-size 8, TPOT grows linear
  • For --tensor-parallel-size 4, TPOT stays steady

Gemini says there is communication overhead as tensor-parallel-size gets larger.

How can I profile to find out what is happening?

https://preview.redd.it/nxffjulmxreh1.png?width=928&format=png&auto=webp&s=b76140516af5b583b7f099ed090867505af2b558

reddit.com
u/Senior_Tea_842 — 29 days ago

Best local LLM for code completion

I have been looking for a LLM to run locally that shows good performance in the task Code Completion in Vscode.

I tried Qwen 3.6 32b and Continue in Vscode but it didn't work well.

Could anyone suggest a good setup?

reddit.com
u/Senior_Tea_842 — 2 months ago