Best configuration
How do find the best configuration for serving? Which tools do you use? Whats your methodology?
I am using vllm bench for running experiments varying configuration (e.g. pp=8, pp=4). I wonder if this is cost effective.
How do find the best configuration for serving? Which tools do you use? Whats your methodology?
I am using vllm bench for running experiments varying configuration (e.g. pp=8, pp=4). I wonder if this is cost effective.
Sou concursado como dev. Porém, atualmente, minha função é gerenciar a equipe da empresa contratada para desenvolver os softwares utilizando scrum.
Entendo que meu papel no gerenciamento seja aquele de um Product Owner. Porém, quase todo dia tenho de ficar discutindo detalhes técnicos de implantação e de arquitetura, framework, melhoria de código, etc. Isso toma muito tempo além das dailies, planing e refinamento de backlog.
Vou dar um exemplo: quando contrato uma empresa pra construir minha casa usando scrum, não espero ficar discutindo com o mestre de obra sobre o projeto elétrico, encanamento, etc.
Minha visão está errada? Seria um problema de falta de senioridade na equipe de devs? Costuma acontecer assim com vocês? Como eu poderia levar isso pra meu gerente?
Quando atuava no mercado, na minha experiência, não era assim que funcionava.
Sou concursado como dev. Porém, atualmente, minha função é gerenciar a equipe da empresa contratada para desenvolver os softwares utilizando scrum.
Entendo que meu papel no gerenciamento seja aquele de um Product Owner. Porém, quase todo dia tenho de ficar discutindo detalhes técnicos de implantação e de arquitetura, framework, melhoria de código, etc. Isso toma muito tempo além das dailies, planing e refinamento de backlog.
Vou dar um exemplo: quando contrato uma empresa pra construir minha casa usando scrum, não espero ficar discutindo com o mestre de obra sobre o projeto elétrico, encanamento, etc.
Minha visão está errada? Seria um problema de falta de senioridade na equipe de devs? Costuma acontecer assim com vocês? Como eu poderia levar isso pra meu gerente?
Quando atuava no mercado, na minha experiência, não era assim que funcionava.
Do you think it is important to configure numactl --membind to get a better performance?
I ran a toy example where GPU has NUMA Affinity with 0. I got an ~9% improvement.
$ numactl --show
policy: default
preferred node: current
physcpubind: 8 9 10 11 136 137 138 139
cpubind: 0
nodebind: 0
membind: 0 1 2 3 4 5 6 7
preferred:
$ time numactl --membind=0 python memory.py
time: 159.3454790781252
real 2m41.164s
user 2m25.306s
sys 0m16.084s
$ time numactl --membind=7 python memory.py
time: 174.3593455599621
real 2m56.384s
user 2m32.279s
sys 0m24.293s
Cresci numa favela onde vi de tudo (parte dos colegas da rua onde cresci morreu no tráfico). Éramos pobres, mas nunca passei fome. Por meio dos estudos e da sorte, me tornei servidor público perto dos 30 anos. Vivendo sempre num padrão de vida muito abaixo da minha renda mensal, em 10 anos acumulei um certo patrimônio em investimentos (moro de aluguel até hoje, meu único patrimônio físico é um carro popular).
Pensei que, ao alcançar aquela marca de patrimônio, poderia ter alguma paz. Porém, ainda vivo com medo constante de voltar à pobreza. Já discuti isso muito em terapia, mas, como não tive melhora, resolvi postar aqui.
Eu vejo os preços dos imóveis, aluguéis, planos de saúde, mensalidade escolar, inflação... Tudo isso só me faz sentir vulnerável, com receio de voltar à pobreza.
Desculpem-me se eu estiver ferindo alguma regra. Não encontrei outra comunidade mais adequada para postar.
I exported a fine-tuned U-Net model using both ONNX Runtime and torch.export with a fixed input shape of (64, 3, 512, 512).
Here are the benchmark results for average inference time:
I expected ONNX Runtime to perform on par with or faster than PyTorch export.
What could be causing this ~160x slowdown?
onnx_inputs = [torch.randn(64, 3, IMG_SIZE, IMG_SIZE).numpy(force=True)]
ort_session = onnxruntime.InferenceSession(
"./model.onnx", providers=["CUDAExecutionProvider"]
)
onnxruntime_input = {input_arg.name: input_value for input_arg, input_value in zip(ort_session.get_inputs(), onnx_inputs)}
# warm-up
onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
t0 = time.perf_counter()
onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
t1 = time.perf_counter()
I exported a fine-tuned U-Net model using both ONNX Runtime and torch.export with a fixed input shape of (64, 3, 512, 512).
Here are the benchmark results for average inference time:
I expected ONNX Runtime to perform on par with or faster than PyTorch export.
What could be causing this ~160x slowdown?
onnx_inputs = [torch.randn(64, 3, IMG_SIZE, IMG_SIZE).numpy(force=True)]
ort_session = onnxruntime.InferenceSession(
"./model.onnx", providers=["CUDAExecutionProvider"]
)
onnxruntime_input = {input_arg.name: input_value for input_arg, input_value in zip(ort_session.get_inputs(), onnx_inputs)}
# warm-up step
onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
# measuring latency
t0 = time.perf_counter()
onnxruntime_outputs = ort_session.run(None, onnxruntime_input)[0]
t1 = time.perf_counter()
I running some experiments to find the best deployment configuration using VLLM and Qwen3.6 27b.
As the parameter --max-concurrency in vllm bench gets larger:
Gemini says there is communication overhead as tensor-parallel-size gets larger.
How can I profile to find out what is happening?
I have been looking for a LLM to run locally that shows good performance in the task Code Completion in Vscode.
I tried Qwen 3.6 32b and Continue in Vscode but it didn't work well.
Could anyone suggest a good setup?